Ollama Windows安裝部署運行模型全指南(含手動導入GGUF模型)
從官網(wǎng)下載到模型導入,手把手教你搞定本地大模型
最近本地跑大模型是越來越火了,Ollama作為最流行的本地LLM工具,對Windows用戶也越來越友好。自己動手倒騰了一下,并把過程給大家總結(jié)出來,寫一篇完整的Windows安裝教程,從零開始,一直到手動導入GGUF模型,全部走一遍。
這篇文章會覆蓋三種場景:
- 場景一:純小白,只想用官網(wǎng)直接安裝、跑模型
- 場景二:需要手動轉(zhuǎn)換 Safetensors 格式為 GGUF 格式再導入
- 場景三:國內(nèi)用戶配置鏡像加速
一、Ollama是什么?為什么選它?
簡單說,Ollama就是一個讓你在本地輕松運行大語言模型的工具。你不需要懂Python環(huán)境、不需要配置CUDA、不需要折騰各種依賴——下載安裝,一條命令就能跑起來。
它對Windows用戶的最大價值:把“跑大模型”這件事,從“工程師專屬”變成了“人人可玩”。
二、直接安裝(官方推薦)
Ollama提供了官方的Windows預覽版,這是最主流的安裝方式。
第1步:訪問官網(wǎng)
打開瀏覽器,進入Ollama官方下載頁面:
https://ollama.com/download
第2步:下載Windows版本
頁面會自動檢測你的操作系統(tǒng),你會看到一個醒目的 Download for Windows 按鈕。點擊它,下載一個 .exe 安裝文件(通常叫 OllamaSetup.exe)。如下圖:

第3步:運行安裝程序
雙擊下載好的 OllamaSetup.exe,開始安裝:
- 如果彈出 用戶賬戶控制(UAC) 窗口,點擊 “是”
- 安裝程序會自動完成所有步驟,包括:
- 安裝Ollama核心文件
- 把
ollama命令添加到系統(tǒng) PATH環(huán)境變量(這一步很重要,否則終端里識別不了)
整個安裝過程是全自動的,不需要你做額外配置。
第4步:驗證安裝是否成功
安裝完成后,建議重啟一下終端(Command Prompt或PowerShell),確保環(huán)境變量已生效。
打開終端(Win + S,輸入 cmd 或 powershell),輸入:
ollama --version
如果看到類似這樣的輸出,說明安裝成功了:
ollama version 0.5.1
如果提示“無法識別命令”,說明環(huán)境變量沒有生效,重啟終端或重啟電腦后再試。
三、運行你的第一個模型
安裝完成后,跑一個模型有多簡單?只需一條命令。
第1步:下載并運行模型
在終端中輸入以下命令(以 qwen3.5-9b 為例):
ollama run qwen3.5-9b
Ollama會自動下載模型,下載完成后自動進入交互式聊天界面。
如果你在國內(nèi),下載速度很慢怎么辦? 往下翻到“第六節(jié)”,有鏡像源配置教程。
第2步:開始對話
下載完成后,你會進入交互式聊天界面。輸入 Hello! 試試:
>>> Hello! 你好!很高興見到你。有什么我可以幫你的嗎?
第3步:退出對話
輸入 /bye 或按 Ctrl + D 即可退出。
第4步:停止模型運行
模型會默認在后臺保持運行,以便下次快速響應。如果你想手動停止它,使用:
ollama stop qwen3.5-9b
四、高級場景:手動導入Safetensors模型(GGUF轉(zhuǎn)換指南)
這是本文的重點——如果你已經(jīng)通過瀏覽器或其他工具下載了模型,但下載的是 Safetensors格式(包含多個.safetensors分片文件),那么需要先轉(zhuǎn)換成 GGUF格式,再導入Ollama。
為什么要轉(zhuǎn)換?
Ollama底層依賴 llama.cpp引擎,它只認 GGUF格式。Safetensors是HuggingFace生態(tài)的通用格式,不能直接在Ollama中運行。
兩個重要提醒:
1. 推薦直接用已轉(zhuǎn)換好的GGUF模型
如果你在魔搭社區(qū)(modelscope)看到“GGUF”版塊,直接下載GGUF格式就好,省去轉(zhuǎn)換這一步。
2. 轉(zhuǎn)換需要一定時間
轉(zhuǎn)換模型會消耗CPU/GPU資源,7B模型大概需要幾分鐘,34B模型可能要半小時以上。
第1步:安裝llama.cpp轉(zhuǎn)換工具
首先克隆llama.cpp倉庫并安裝依賴:
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp pip install -r requirements.txt
提示:如果你網(wǎng)絡訪問GitHub慢,可以用國內(nèi)鏡像源。安裝依賴時如果下載慢,可以用清華源:pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
第2步:執(zhí)行格式轉(zhuǎn)換
假設你的Safetensors模型存放在 D:\models\qwen3.5-9b 目錄下:
python convert_hf_to_gguf.py D:\models\qwen3.5-9b --outtype f16 --outfile D:\models\qwen3.5-9b.gguf
參數(shù)說明:
| 參數(shù) | 含義 | 說明 |
|---|---|---|
convert_hf_to_gguf.py | 轉(zhuǎn)換腳本 | 位置在 llama.cpp 根目錄 |
--outtype f16 | 輸出精度 | f16表示半精度,q8_0表示8位量化,文件更小 |
--outfile | 輸出路徑 | 指定生成的 .gguf 文件名和位置 |
第3步:編寫Modelfile配置文件
在 .gguf 文件同級目錄下,新建一個無后綴的文本文件,命名為 Modelfile。
用記事本打開,寫入以下內(nèi)容:
FROM ./qwen3.5-9b.gguf
保存即可。
為什么推薦用相對路徑? 因為Modelfile和gguf在同一目錄下,用
./最穩(wěn)妥,不會因路徑錯誤導致導入失敗。
第4步:導入并運行模型
打開終端(CMD或PowerShell),進入模型所在目錄:
創(chuàng)建模型(注意:必須用 -f 參數(shù)指向Modelfile):
ollama create qwen3.5-9b -f .\Modelfile
運行模型:
ollama run qwen3.5-9b
手動轉(zhuǎn)換完整流程圖示
?? 原始Safetensors模型(多個分片)
↓
convert_hf_to_gguf.py 轉(zhuǎn)換
↓
?? qwen3.5-9b.gguf (單個文件)
+
?? Modelfile(配置文件)
↓
ollama create -f Modelfile
↓
? 可運行的Ollama模型
五、鏡像源列表
| 鏡像站 | URL | 說明 |
|---|---|---|
| 魔搭社區(qū) | https://ollama.modelscope.cn | ? 推薦,國內(nèi)速度最快 |
| 阿里云 | https://registry.ollama.ai | 阿里云提供,穩(wěn)定 |
| DeepSeek官方 | https://ollama.deepseek.com | DeepSeek官方鏡像 |
| 浙江大學 | https://ollama.zju.edu.cn | 教育網(wǎng)用戶首選 |
六、常用命令速查
| 命令 | 作用 |
|---|---|
ollama --version | 查看版本號 |
ollama list | 列出已安裝的模型 |
ollama run <模型名> | 運行模型 |
ollama pull <模型名> | 僅下載模型,不運行 |
ollama stop <模型名> | 停止模型運行 |
ollama create <模型名> -f ./Modelfile | 從Modelfile創(chuàng)建模型 |
七、常見問題排查
Ollama 本地部署錯題集
1. 錯誤:Error: unknown flag: --from
- 問題描述:在執(zhí)行
ollama create時,使用了--from參數(shù)直接指向本地模型文件,導致提示未知標志。 - 原因分析:Ollama 的
create命令不支持--from這個參數(shù)。導入本地模型必須通過一個名為Modelfile的配置文件來進行。 - 解決方案:
- 在模型所在目錄創(chuàng)建一個無后綴的
Modelfile文件。 - 在文件中寫入
FROM <模型文件路徑>(例如FROM .\qwen3.5-9b.gguf)。 - 使用
-f參數(shù)指向該配置文件:ollama create <模型名> -f .\Modelfile。
- 在模型所在目錄創(chuàng)建一個無后綴的
2. 錯誤:Error: read <路徑>: Incorrect function.
- 問題描述:將
.gguf模型文件的路徑直接傳給了-f參數(shù)(如ollama create xxx -f D:\AI\models\xxx.gguf),導致底層讀取報錯。 - 原因分析:
-f參數(shù)的作用是讀取文本格式的配置文件(Modelfile),而不是直接讀取二進制的模型文件。Ollama 嘗試把.gguf當作文本解析,從而引發(fā)系統(tǒng)級讀取錯誤。 - 解決方案:嚴格遵循 Modelfile 機制。
-f后面只能接Modelfile,而模型的實際路徑需要寫在Modelfile的FROM指令中。
3. 錯誤:Error: accepts 1 arg(s), received 2
- 問題描述:在執(zhí)行
ollama create qwen3.5-9b .\Modelfile時,提示參數(shù)數(shù)量錯誤。 - 原因分析:漏寫了
-f參數(shù)。Ollama 將qwen3.5-9b和.\Modelfile識別為了兩個獨立的位置參數(shù),但該命令只接受一個參數(shù)(模型名稱)。 - 解決方案:補全
-f參數(shù),正確語法為:ollama create qwen3.5-9b -f .\Modelfile。
4. 錯誤:Error: (line 1): command must be one of "from", "license"...
- 問題描述:在創(chuàng)建模型時,直接將
.gguf文件作為 Modelfile 傳入,或者 Modelfile 內(nèi)容格式錯誤。 - 原因分析:Ollama 解析 Modelfile 時,要求第一行必須是合法的指令(如
FROM)。如果直接把.gguf文件當成配置文件讀取,Ollama 無法識別其開頭的二進制亂碼。 - 解決方案:確保
Modelfile是一個純文本文件,且第一行嚴格為FROM <模型路徑>。
5. 隱藏坑點:Windows 路徑含空格導致運行失敗
- 問題描述:模型創(chuàng)建成功,但在執(zhí)行
ollama run時直接報錯或無法啟動。 - 原因分析:這是 Ollama 在 Windows 環(huán)境下的已知 Bug。如果模型所在的文件夾路徑或文件名中包含空格(如
D:\AI Models\...),Ollama 會解析失敗。 - 解決方案:將模型文件和 Modelfile 移動到絕對沒有空格的路徑下(例如
D:\AI_models\),并同步更新 Modelfile 中的FROM路徑。
6. 隱藏坑點:Safetensors 格式無法直接運行
- 問題描述:從 ModelScope 下載的模型包含多個
model.safetensors文件,嘗試導入 Ollama 失敗。 - 原因分析:Ollama 底層依賴 llama.cpp 引擎,只識別 GGUF 格式。Safetensors 是 PyTorch 生態(tài)格式,無法被直接解析。
- 解決方案:必須先使用
llama.cpp提供的convert_hf_to_gguf.py腳本,將 Safetensors 轉(zhuǎn)換為 GGUF 格式后,再執(zhí)行導入流程。
結(jié)語
以上就是Ollama在Windows上的完整安裝部署指南,從最基礎的“一鍵安裝”到“手動導入GGUF模型”都走了一遍。
如果你是初學者,推薦這樣做:
- 先走“直接安裝”流程,用
ollama run qwen3.5-9b跑通第一個模型 - 熟悉基本命令后,再嘗試手動導入自己的GGUF模型
- 按照“常見問題排查”處理遇到的報錯
全部走通之后,你就擁有了一個完全在本地運行、無需聯(lián)網(wǎng)、隱私安全的大模型運行環(huán)境。下一步就是玩各種有趣的玩法了——比如搭建本地知識庫、跑Agent、或者做自己的AI應用。
以上就是Ollama Windows安裝部署運行模型全指南(含手動導入GGUF模型)的詳細內(nèi)容,更多關于Ollama Windows安裝部署運行的資料請關注腳本之家其它相關文章!
相關文章
Ollama 官方 Windows 安裝程序沒有提供路徑選擇,直接雙擊就只有“Install”按鈕,但我們可以通過以下方法實現(xiàn)自定義安裝路徑,需要的朋友可以參考下2026-05-20
Windows系統(tǒng)使用Ollama部署本地大模型的實現(xiàn)步驟
本文主要介紹了在Ollama平臺下載和安裝AI模型的方法,包括點擊按鈕安裝和使用指令下載兩種方式,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價2026-04-29
Windows11下Ollama部署Qwen2.5大模型的實戰(zhàn)指南
本文旨在記錄 如何在Windows 11 本地環(huán)境下,利用 Ollama 部署 Qwen2.5 大模型,并實現(xiàn) API 調(diào)用,無需顯卡也能跑”、能夠確保隱私安全,有需要的小伙伴可以跟隨小編一起了解2026-03-18
Ollama 簡單安裝(windows/mac/linux/docker)
Ollama 支持多種操作系統(tǒng),包括 macOS、Windows、Linux 以及通過 Docker 容器運行,Ollama 對硬件要求不高,旨在讓用戶能夠輕松地在本地運行、管理和與大型語言模型進行交互2026-03-07





