Ollama 運行模型(Ollama 模型的簡要指南)
運行 Ollama 模型是在本地使用大語言模型(LLM)進行推理、對話或其他任務(wù)的核心步驟。以下是運行 Ollama 模型的簡要指南,涵蓋拉取模型、運行模型以及常見配置,適用于已安裝 Ollama 的 Windows、macOS 或 Linux 系統(tǒng)。
一. 拉取模型
在運行模型之前,需要從 Ollama 模型庫下載模型到本地。
命令:
ollama pull <model-name>
示例:拉取 LLaMA 3 模型(8B 參數(shù)版本):
ollama pull llama3
常見模型:
llama3:Meta 的 LLaMA 3,適合通用任務(wù)。mistral:Mistral AI 的高效模型。phi3:微軟的輕量級模型,適合低配置設(shè)備。
查看更多模型:訪問 Ollama 模型庫 或運行 ollama list。
注意:
模型文件較大(幾 GB),確保網(wǎng)絡(luò)穩(wěn)定和磁盤空間充足。
可選擇不同大小的模型(如 llama3:8b 或 llama3:70b),小模型更適合低配硬件。
二. 運行模型
Ollama 提供兩種主要方式運行模型:交互式終端和 API 調(diào)用。
方式 1:交互式終端
命令:
ollama run <model-name>
示例:
ollama run llama3
效果:
進入交互模式,直接輸入提示(prompt)與模型對話。
示例輸入:What is the capital of France? 模型會返回 The capital of France is Paris.
退出:輸入 /exit 或按 Ctrl+D。
方式 2:通過 API 運行
Ollama 提供 REST API,適合集成到應(yīng)用或腳本中。
默認(rèn)地址:http://localhost:11434
示例(使用 curl):
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Write a short poem about the moon."
}'響應(yīng):模型會返回生成的文本,格式為 JSON。
編程集成:使用 Python、Node.js 等調(diào)用 API。例如 Python 代碼:
import requests
response = requests.post('http://localhost:11434/api/generate', json={
'model': 'llama3',
'prompt': 'Hello, world!'
})
print(response.json())三. 管理運行中的模型
查看已下載模型:
ollama list
刪除模型(釋放空間):
ollama rm <model-name>
查看運行狀態(tài):
ollama ps
AI寫代碼bash
顯示當(dāng)前運行的模型實例。
四. 優(yōu)化運行性能
硬件要求:
小模型(如 phi3):4-8GB 內(nèi)存即可。
大模型(如 llama3:70b):建議 16GB+ 內(nèi)存和 GPU。
GPU 支持:
確保安裝 NVIDIA CUDA 驅(qū)動(Linux/Windows)或 Metal(macOS)。
Ollama 自動檢測并使用 GPU 加速(若可用)。
參數(shù)調(diào)整:
使用 --verbose 查看運行詳情。
自定義模型參數(shù)(如溫度、top-k):通過 API 指定,例如:
{
"model": "llama3",
"prompt": "Tell a story",
"temperature": 0.7,
"top_p": 0.9
}多模型運行:
Ollama 支持同時運行多個模型,但需足夠內(nèi)存和 CPU/GPU 資源。
五. 常見問題
模型未找到:確保已通過 ollama pull 下載模型。
運行緩慢:嘗試更小模型或啟用 GPU 加速。
端口占用:Ollama 默認(rèn)使用 11434 端口,若沖突,可通過環(huán)境變量修改:
export OLLAMA_HOST=127.0.0.1:11435
內(nèi)存不足:關(guān)閉其他程序或選擇更小模型。
六. 進階使用
自定義模型:[通過 Modelfile 創(chuàng)建自定義模型,定義提示、參數(shù)等:
ollama create mymodel -f Modelfile
批量處理:編寫腳本循環(huán)調(diào)用 API,處理大量任務(wù)。
嵌入生成:使用 /api/embeddings 端點生成文本嵌入,適用于搜索或分類任務(wù)。
示例場景
對話:運行 ollama run mistral 與模型聊天。
代碼生成:輸入 Write a Python script to sort a list 獲取代碼。
API 集成:將 Ollama 嵌入 Web 應(yīng)用,實時生成內(nèi)容。
如需特定模型運行示例、API 集成代碼或故障排除幫助,請告訴我!
七.ollama run 命令
Ollama 運行模型使用 ollama run 命令。
例如我們要運行 Llama 3.2 并與該模型對話可以使用以下命令:
ollama run llama3.2
執(zhí)行以上命令如果沒有該模型會去下載 llama3.2 模型:

等待下載完成后,我們在終端中,輸入以下命令來加載 LLama3.2 模型并進行交互:
writing manifest success >>> 你好 Hello >>> 能講中文嗎 是的,我可以在 Chinese 中對話。哪些話題或問題想要了解我呢?
結(jié)束對話可以輸入 /bye 或按 Ctrl+d 按鍵來結(jié)束。
我們可以使用 ollama list,查看已安裝的模型:
NAME ID SIZE MODIFIED llama3.2 baf6a787fdff 1.3 GB 4 minutes ago
Ollama 支持的模型可以訪問:https://ollama.com/library

下表列出一些模型的下載命令:
| 模型 | 參數(shù) | 大小 | 下載命令 |
|---|---|---|---|
| Llama 3.3 | 70B | 43GB | ollama run llama3.3 |
| Llama 3.2 | 3B | 2.0GB | ollama run llama3.2 |
| Llama 3.2 | 1B | 1.3GB | ollama run llama3.2:1b |
| Llama 3.2 Vision | 11B | 7.9GB | ollama run llama3.2-vision |
| Llama 3.2 Vision | 90B | 55GB | ollama run llama3.2-vision:90b |
| Llama 3.1 | 8B | 4.7GB | ollama run llama3.1 |
| Llama 3.1 | 405B | 231GB | ollama run llama3.1:405b |
| Phi 4 | 14B | 9.1GB | ollama run phi4 |
| Phi 3 Mini | 3.8B | 2.3GB | ollama run phi3 |
| Gemma 2 | 2B | 1.6GB | ollama run gemma2:2b |
| Gemma 2 | 9B | 5.5GB | ollama run gemma2 |
| Gemma 2 | 27B | 16GB | ollama run gemma2:27b |
| Mistral | 7B | 4.1GB | ollama run mistral |
| Moondream 2 | 1.4B | 829MB | ollama run moondream |
| Neural Chat | 7B | 4.1GB | ollama run neural-chat |
| Starling | 7B | 4.1GB | ollama run starling-lm |
| Code Llama | 7B | 3.8GB | ollama run codellama |
| Llama 2 Uncensored | 7B | 3.8GB | ollama run llama2-uncensored |
| LLaVA | 7B | 4.5GB | ollama run llava |
| Solar | 10.7B | 6.1GB | ollama run solar |
八.通過 Python SDK 使用模型
如果你希望將 Ollama 與 Python 代碼集成,可以使用 Ollama 的 Python SDK 來加載和運行模型。
1. 安裝 Python SDK
首先,需要安裝 Ollama 的 Python SDK,打開終端,執(zhí)行以下命令:
pip install ollama
2. 編寫 Python 腳本
接下來,你可以使用 Python 代碼來加載和與模型交互。
以下是一個簡單的 Python 腳本示例,演示如何使用 LLama3.2 模型來生成文本:
import?ollama response?=?ollama.generate( ? ? model="llama3.2",??# 模型名稱 ? ? prompt="你是誰。"??# 提示文本 ) print(response)
3. 運行 Python 腳本
在終端中運行你的 Python 腳本:
python test.py
你會看到模型根據(jù)你的輸入返回的回答。
4.對話模式
from?ollama?import?chat
response?=?chat(
? ? model="llama3.2",
? ? messages=[
? ? ? ??{"role":?"user",?"content":?"為什么天空是藍(lán)色的?"}
? ??]
)
print(response.message.content)此代碼會與模型進行對話,并打印模型的回復(fù)。
5. 流式響應(yīng)
from?ollama?import?chat
stream?=?chat(
? ? model="llama3.2",
? ? messages=[{"role":?"user",?"content":?"為什么天空是藍(lán)色的?"}],
? ? stream=True
)
for?chunk?in?stream:
? ??print(chunk["message"]["content"],?end="",?flush=True)此代碼會以流式方式接收模型的響應(yīng),適用于處理大數(shù)據(jù)。
相關(guān)文章
本文對開源本地大模型運行工具Ollama進行了全面深度評測,涵蓋硬件兼容性、性能表現(xiàn)、功能特性、安全性等10個核心維度,基于2026年最新版本(v0.19.0)的實測數(shù)據(jù),結(jié)合客觀2026-06-01
這段文章詳細(xì)介紹了Ollama、LMStudio、TextGenerationWebUI和vLLM四種部署方式,適合不同模型的本地和企業(yè)環(huán)境部署,文章還提供了Ollama的下載指南和免費開源大模型的推薦版2026-05-25
Ollama 官方 Windows 安裝程序沒有提供路徑選擇,直接雙擊就只有“Install”按鈕,但我們可以通過以下方法實現(xiàn)自定義安裝路徑,需要的朋友可以參考下2026-05-20
2026最新Linux本地部署Ollama安裝全流程(含離線/開機自啟/遠(yuǎn)程訪問)
本文記錄在 CentOS 7+ / Ubuntu 20.04+ 上部署 Ollama 的實操筆記,覆蓋 一鍵在線安裝 與 離線 tar 包安裝 兩種方式,并補充 systemd 開機自啟、qwen2 / deepseek-r1 等模2026-05-19
一篇帶你搞定Ollama模型的安裝到生產(chǎn)級調(diào)優(yōu)
Ollama 是一個輕量級、可擴展的本地大語言模型運行框架,旨在簡化 LLM 的部署、管理和使用流程,本文主要為大家詳細(xì)介紹了Ollama模型的部署、管理和使用,有需要的小伙伴可以2026-05-13
在嘗試將 Ollama 的 localhost 地址替換為本地 IP 地址(如 192.168.*.*)時,遇到了網(wǎng)絡(luò)錯誤,提示無法連接到服務(wù),本文給大家介紹了可能的原因和解決方案,需要的朋友可以2026-05-12
Ollama下載的模型如何導(dǎo)入LLama-Factory進行二次微調(diào)
本文介紹如何將Ollama下載的GGUF格式模型轉(zhuǎn)換為Hugging Face格式,并通過LLama-Factory進行LoRA微調(diào),涵蓋模型提取、格式轉(zhuǎn)換、訓(xùn)練配置及合并導(dǎo)出全流程,幫助開發(fā)者在本地2026-05-12
本文介紹了在Windows系統(tǒng)上配置Ollama使用GPU加速的步驟,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起2026-04-30
本文介紹了如何利用Ollama和LangChain構(gòu)建基礎(chǔ)AIAgent,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)2026-04-29
Windows系統(tǒng)使用Ollama部署本地大模型的實現(xiàn)步驟
本文主要介紹了在Ollama平臺下載和安裝AI模型的方法,包括點擊按鈕安裝和使用指令下載兩種方式,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價2026-04-29











