Ollama本地大模型安裝配置的完整流程教學(xué)
Ollama介紹和特性
Ollama是一個(gè)輕量級(jí)、易于使用的大模型管理和部署工具,主要用于簡(jiǎn)化大模型的運(yùn)行和交互。并且為開(kāi)發(fā)者和用戶提供了快速加載、管理和調(diào)用多種主流大模型的能力,同時(shí)支持本地化部署各類(lèi)大模型。
核心特點(diǎn):
- ? 輕量化設(shè)計(jì):Ollama體積小巧,安裝簡(jiǎn)單,適合個(gè)人開(kāi)發(fā)者和小型團(tuán)隊(duì)
- ? 多模型支持:支持多種主流大模型,如Llama系列、Qwen系列、Deepseek系列等
- ? 資源優(yōu)化:通過(guò)量化技術(shù)降低模型顯存占用,減少對(duì)高性能GPU的依賴(lài)
- ? 易用性:提供命令行工具和圖形化界面,方便用戶操作
- ? 擴(kuò)展性強(qiáng):可以與其他工具(如 Kubernetes、Docker)結(jié)合,實(shí)現(xiàn)分布式部署和管理
Ollama與其它工具對(duì)比
Ollama
官網(wǎng):https://ollama.com/
安裝簡(jiǎn)單,提供 CLI 和 WebUI,適合初學(xué)者和開(kāi)發(fā)者。支持量化技術(shù)降低內(nèi)存占用,適合普通硬件、支持 Linux、macOS 和 Windows、支持大部分主流模型。但是 Ollama 并發(fā)性能不如 vLLM。
vLLM
官網(wǎng):https://vllm.ai/
vLLM 是一個(gè)高效的大模型推理和服務(wù)引擎,在多 GPU 環(huán)境下性能表現(xiàn)優(yōu)異,更適合大規(guī)模在線推理服務(wù)。但是 vLLM 的部署復(fù)雜度較高,需要一定的技術(shù)基礎(chǔ),主要面向 Linux,跨平臺(tái)支持有限。
LocalAI
官網(wǎng):https://localai.io/
LocalAI 和 Ollama 相似,是一個(gè)輕量級(jí)的本地大模型服務(wù)框架,開(kāi)箱即用,無(wú)需復(fù)雜配置。但是性能優(yōu)化不如 vLLM 和 Ollama,并且功能較少,比如不支持多線程加速等。
Ollama安裝部署
Linux 手動(dòng)安裝 Ollama
下載并安裝 Ollama:
curl -L https://ollama.com/download/ollama-linux-amd64.tgz -o ollama-linux-amd64.tgz sudo tar -C /usr -xzf ollama-linux-amd64.tgz
創(chuàng)建 Ollama 專(zhuān)用用戶:
sudo useradd -r -s /bin/false -U -m -d /usr/share/ollama ollama sudo usermod -a -G ollama $(whoami)
創(chuàng)建 Ollama 模型存儲(chǔ)目錄:
mkdir /data/ollama/models chown -R ollama.ollama /data/ollama/
創(chuàng)建 Ollama 啟動(dòng) Service:
[Unit] Description=Ollama Service After=network-online.target [Service] ExecStart=/usr/bin/ollama serve User=ollama Group=ollama Restart=always RestartSec=3 Environment="OLLAMA_HOST=0.0.0.0:11434" Environment="OLLAMA_MODELS=/data/ollama/models" [Install] WantedBy=default.target
將上述配置保存到 /etc/systemd/system/ollama.service
啟動(dòng) Ollama 服務(wù):
systemctl daemon-reload systemctl enable --now ollama
查看啟動(dòng)狀態(tài):
systemctl status ollama
預(yù)期輸出:
● ollama.service - Ollama Service Loaded: loaded (/etc/systemd/system/ollama.service; enabled; vendor preset: disabled) Active: active (running) since ...
測(cè)試端口:
curl 127.0.0.1:11434
預(yù)期輸出:
Ollama is running
Ollama 常用命令詳解
下載模型
ollama pull deepseek-r1:1.5b
輸出示例:
pulling manifest
pulling aabd4debf0c8... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 1.1 GB
pulling 369ca498f347... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 387 B
pulling 6e4c38e1172f... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 1.1 KB
pulling f4d24e9138dd... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 148 B
pulling a85fe2a2e58e... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 487 B
verifying sha256 digest
writing manifest
success
查看本地模型列表
ollama list
輸出示例:
NAME ID SIZE MODIFIED
deepseek-r1:1.5b a42b25d8c10a 1.1 GB 3 minutes ago
phi:latest e2fd6321a5fe 1.6 GB 27 minutes ago
查看模型詳情
ollama show deepseek-r1:1.5b
輸出示例:
architecture qwen2
parameters 1.8B
context length 131072
embedding length 1536
quantization Q4_K_M
Parameters
stop "<|begin▁of▁sentence|>"
stop "<|end▁of▁sentence|>"
stop "<|User|>"
stop "<|Assistant|>"
License
MIT License
Copyright (c) 2023 DeepSeek
啟動(dòng)一個(gè)模型并進(jìn)入交互模式
ollama run phi
交互示例:
>>> who are you?
I am Phi, a large language model trained by Microsoft. I'm here to help you with any questions or tasks you have. What can I assist you with today?
查看當(dāng)前正在運(yùn)行的模型
ollama ps
輸出示例:
NAME ID SIZE PROCESSOR UNTIL
phi:latest e2fd6321a5fe 5.4 GB 100% GPU 4 minutes from now
deepseek-r1:1.5b a42b25d8c10a 2.0 GB 100% GPU About a minute from now
停止一個(gè)運(yùn)行中的模型
ollama stop phi:latest
停止后再次查看:
ollama ps
輸出示例:
NAME ID SIZE PROCESSOR UNTIL
deepseek-r1:1.5b a42b25d8c10a 2.0 GB 100% GPU 17 seconds from now
刪除一個(gè)本地模型
ollama rm phi:latest
輸出示例:
deleted 'phi:latest'
刪除后再次查看:
ollama list
輸出示例:
NAME ID SIZE MODIFIED
deepseek-r1:1.5b a42b25d8c10a 1.1 GB 42 hours ago
Ollama WebUI 部署
注意:Ollama WebUI 需要使用 Docker 啟動(dòng),如果服務(wù)器沒(méi)有安裝 Docker,需要先安裝 Docker。
創(chuàng)建數(shù)據(jù)目錄:
mkdir -p /data/ollama/webui
直接使用 docker 部署即可:
docker run -d -p 3000:8080 -e ENABLE_OPENAI_API=false -e OLLAMA_BASE_URL=http://[OLLAMA_HOST]:11434 -e HF_HUB_OFFLINE=1 -v /data/ollama/models:/root/.ollama -v /data/ollama/webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
啟動(dòng)后通過(guò)宿主機(jī)的 3000 端口訪問(wèn)即可。
Ollama 服務(wù)端常用配置
啟動(dòng) Ollama 服務(wù)端:
ollama serve
使用自定義端口啟動(dòng):
OLLAMA_HOST=0.0.0.0:11435 ollama serve
常用環(huán)境變量:
| 環(huán)境變量 | 說(shuō)明 | 默認(rèn)值 |
|---|---|---|
OLLAMA_DEBUG | 啟用調(diào)試模式,設(shè)置為 1 表示開(kāi)啟 | - |
OLLAMA_HOST | 指定 Ollama 服務(wù)綁定的 IP 地址和端口 | 127.0.0.1:11434 |
OLLAMA_KEEP_ALIVE | 設(shè)置模型在內(nèi)存中保持加載的時(shí)間 | 5m |
OLLAMA_MAX_LOADED_MODELS | 限制每塊 GPU 上同時(shí)加載的最大模型數(shù)量 | - |
OLLAMA_MAX_QUEUE | 設(shè)置請(qǐng)求隊(duì)列的最大長(zhǎng)度,超過(guò)限制新請(qǐng)求會(huì)被拒絕 | - |
OLLAMA_MODELS | 指定模型文件存儲(chǔ)的目錄路徑 | ~/.ollama/models |
OLLAMA_NUM_PARALLEL | 限制同時(shí)處理的最大并行請(qǐng)求數(shù) | - |
OLLAMA_NOPRUNE | 禁用啟動(dòng)時(shí)模型清理操作 | - |
OLLAMA_ORIGINS | 指定允許跨域訪問(wèn)的來(lái)源列表(逗號(hào)分隔) | - |
OLLAMA_SCHED_SPREAD | 強(qiáng)制將模型調(diào)度到所有可用 GPU 上,均勻分布 | - |
OLLAMA_FLASH_ATTENTION | 啟用 Flash Attention 技術(shù),硬件不支持可能報(bào)錯(cuò) | - |
OLLAMA_KV_CACHE_TYPE | 指定 K/V 緩存的量化類(lèi)型 | f16 |
OLLAMA_GPU_OVERHEAD | 預(yù)留顯存,防止其他進(jìn)程因顯存不足而崩潰 | - |
OLLAMA_LOAD_TIMEOUT | 設(shè)置模型加載的最大超時(shí)時(shí)間(分鐘) | 5m |
限制使用指定GPU
默認(rèn)情況下,Ollama 可以使用所有可用 GPU 進(jìn)行模型推理。如果需要限制 Ollama 只能使用特定的 GPU,可以通過(guò) CUDA_VISIBLE_DEVICES 環(huán)境變量進(jìn)行控制。
例如,限制 Ollama 只能使用 0 和 1 兩個(gè) GPU,編輯 /etc/systemd/system/ollama.service:
[Unit] Description=Ollama Service After=network-online.target [Service] ExecStart=/usr/bin/ollama serve User=ollama Group=ollama Restart=always RestartSec=3 Environment="OLLAMA_HOST=0.0.0.0:11434" Environment="OLLAMA_MODELS=/data/ollama/models" Environment="CUDA_VISIBLE_DEVICES=0,1" [Install] WantedBy=default.target
修改完成后,重新加載配置并重啟 Ollama 服務(wù):
systemctl daemon-reload systemctl restart ollama
進(jìn)階說(shuō)明
如果你的系統(tǒng)中搭載了多張英偉達(dá)顯卡,且希望限制 Ollama 僅使用其中部分顯卡,可將 CUDA_VISIBLE_DEVICES 設(shè)置為以逗號(hào)分隔的顯卡列表。
- 使用數(shù)字編號(hào):可以直接使用數(shù)字編號(hào)作為顯卡標(biāo)識(shí),但編號(hào)順序可能會(huì)發(fā)生變化
- 使用 UUID(推薦):使用 UUID 更為可靠,不會(huì)因硬件變更而改變
查看顯卡的 UUID:
nvidia-smi -L
強(qiáng)制使用 CPU 運(yùn)算:如果想忽略顯卡并強(qiáng)制 Ollama 使用 CPU 運(yùn)算,可輸入無(wú)效的顯卡編號(hào),例如:
Environment="CUDA_VISIBLE_DEVICES=-1"
到此這篇關(guān)于Ollama本地大模型安裝配置的完整流程教學(xué)的文章就介紹到這了,更多相關(guān)Ollama本地大模型安裝配置內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章,希望大家以后多多支持腳本之家!
相關(guān)文章

Python + Ollama 本地跑大模型:零成本搭建你的私有 AI 助手
文章介紹Ollama本地AI助手的安裝方法,從環(huán)境準(zhǔn)備、快速上手到實(shí)戰(zhàn)項(xiàng)目,并探討了其核心優(yōu)勢(shì),包括零成本、零數(shù)據(jù)風(fēng)險(xiǎn)、零門(mén)檻和零妥協(xié),通過(guò)使用Ollama,用戶可以在本地運(yùn)行大2026-04-09
三種快速安裝下載OLLAMA的方法小結(jié)(任何版本都適用)
本文主要介紹了三種快速下載OLLAMA的方法小結(jié),文中通過(guò)圖文步驟介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2026-03-31
ollama本地部署DeepSeek教程的實(shí)現(xiàn)
本文主要介紹如何使用ollama本地部署deepseek大模型,以及使用WebUI工具界面進(jìn)行交互,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需2026-03-31
Docker部署Ollama搭建本地AI開(kāi)發(fā)環(huán)境
本文介紹如何通過(guò)Docker+Ollama搭建本地AI開(kāi)發(fā)環(huán)境,解決云端API調(diào)用成本高、延遲大的問(wèn)題,幫助開(kāi)發(fā)者快速實(shí)現(xiàn)本地AI應(yīng)用開(kāi)發(fā),無(wú)需擔(dān)心API調(diào)用限制和費(fèi)用問(wèn)題,感興趣的可2026-03-30
Windows11下Ollama部署Qwen2.5大模型的實(shí)戰(zhàn)指南
本文旨在記錄 如何在Windows 11 本地環(huán)境下,利用 Ollama 部署 Qwen2.5 大模型,并實(shí)現(xiàn) API 調(diào)用,無(wú)需顯卡也能跑”、能夠確保隱私安全,有需要的小伙伴可以跟隨小編一起了解2026-03-18
與 Ollama 模型交互是使用大語(yǔ)言模型(LLM)進(jìn)行對(duì)話、生成文本或執(zhí)行任務(wù)的核心功能,Ollama 提供兩種主要交互方式:通過(guò)命令行界面(CLI)的交互式終端和通過(guò) REST API 的2026-03-09
Ollama 提供了多種方式與模型進(jìn)行交互,其中最常見(jiàn)的就是通過(guò)命令行進(jìn)行推理操作2026-03-09







