最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Ollama本地大模型安裝配置的完整流程教學(xué)

  發(fā)布時(shí)間:2026-04-12 11:03:23   作者:大崔的Linux導(dǎo)航   我要評(píng)論
Ollama是一個(gè)輕量級(jí)、易于使用的大模型管理和部署工具,主要用于簡(jiǎn)化大模型的運(yùn)行和交互,并且為開(kāi)發(fā)者和用戶提供了快速加載,管理和調(diào)用多種主流大模型的能力,下面我們就來(lái)看看Ollama本地大模型安裝配置的完整教程吧

Ollama介紹和特性

Ollama是一個(gè)輕量級(jí)、易于使用的大模型管理和部署工具,主要用于簡(jiǎn)化大模型的運(yùn)行和交互。并且為開(kāi)發(fā)者和用戶提供了快速加載、管理和調(diào)用多種主流大模型的能力,同時(shí)支持本地化部署各類(lèi)大模型。

核心特點(diǎn):

  • ? 輕量化設(shè)計(jì):Ollama體積小巧,安裝簡(jiǎn)單,適合個(gè)人開(kāi)發(fā)者和小型團(tuán)隊(duì)
  • ? 多模型支持:支持多種主流大模型,如Llama系列、Qwen系列、Deepseek系列等
  • ? 資源優(yōu)化:通過(guò)量化技術(shù)降低模型顯存占用,減少對(duì)高性能GPU的依賴(lài)
  • ? 易用性:提供命令行工具和圖形化界面,方便用戶操作
  • ? 擴(kuò)展性強(qiáng):可以與其他工具(如 Kubernetes、Docker)結(jié)合,實(shí)現(xiàn)分布式部署和管理

Ollama與其它工具對(duì)比

Ollama

官網(wǎng):https://ollama.com/

安裝簡(jiǎn)單,提供 CLI 和 WebUI,適合初學(xué)者和開(kāi)發(fā)者。支持量化技術(shù)降低內(nèi)存占用,適合普通硬件、支持 Linux、macOS 和 Windows、支持大部分主流模型。但是 Ollama 并發(fā)性能不如 vLLM。

vLLM

官網(wǎng):https://vllm.ai/

vLLM 是一個(gè)高效的大模型推理和服務(wù)引擎,在多 GPU 環(huán)境下性能表現(xiàn)優(yōu)異,更適合大規(guī)模在線推理服務(wù)。但是 vLLM 的部署復(fù)雜度較高,需要一定的技術(shù)基礎(chǔ),主要面向 Linux,跨平臺(tái)支持有限。

LocalAI

官網(wǎng):https://localai.io/

LocalAI 和 Ollama 相似,是一個(gè)輕量級(jí)的本地大模型服務(wù)框架,開(kāi)箱即用,無(wú)需復(fù)雜配置。但是性能優(yōu)化不如 vLLM 和 Ollama,并且功能較少,比如不支持多線程加速等。

Ollama安裝部署

Linux 手動(dòng)安裝 Ollama

下載并安裝 Ollama:

curl -L https://ollama.com/download/ollama-linux-amd64.tgz -o ollama-linux-amd64.tgz
sudo tar -C /usr -xzf ollama-linux-amd64.tgz

創(chuàng)建 Ollama 專(zhuān)用用戶:

sudo useradd -r -s /bin/false -U -m -d /usr/share/ollama ollama
sudo usermod -a -G ollama $(whoami)

創(chuàng)建 Ollama 模型存儲(chǔ)目錄:

mkdir /data/ollama/models
chown -R ollama.ollama /data/ollama/

創(chuàng)建 Ollama 啟動(dòng) Service:

[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_MODELS=/data/ollama/models"

[Install]
WantedBy=default.target

將上述配置保存到 /etc/systemd/system/ollama.service

啟動(dòng) Ollama 服務(wù):

systemctl daemon-reload
systemctl enable --now ollama

查看啟動(dòng)狀態(tài):

systemctl status ollama

預(yù)期輸出:

● ollama.service - Ollama Service
   Loaded: loaded (/etc/systemd/system/ollama.service; enabled; vendor preset: disabled)
   Active: active (running) since ...

測(cè)試端口:

curl 127.0.0.1:11434

預(yù)期輸出:

Ollama is running

Ollama 常用命令詳解

下載模型

ollama pull deepseek-r1:1.5b

輸出示例:

pulling manifest
pulling aabd4debf0c8... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 1.1 GB
pulling 369ca498f347... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 387 B
pulling 6e4c38e1172f... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 1.1 KB
pulling f4d24e9138dd... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 148 B
pulling a85fe2a2e58e... 100% ▕██████████████████████████████████████████████████████████████████████████▏ 487 B
verifying sha256 digest
writing manifest
success

查看本地模型列表

ollama list

輸出示例:

NAME               ID            SIZE    MODIFIED
deepseek-r1:1.5b   a42b25d8c10a 1.1 GB  3 minutes ago
phi:latest         e2fd6321a5fe 1.6 GB  27 minutes ago

查看模型詳情

ollama show deepseek-r1:1.5b

輸出示例:

  architecture        qwen2
  parameters          1.8B
  context length      131072
  embedding length    1536
  quantization        Q4_K_M

Parameters
  stop "<|begin▁of▁sentence|>"
  stop "<|end▁of▁sentence|>"
  stop "<|User|>"
  stop "<|Assistant|>"

License
  MIT License
  Copyright (c) 2023 DeepSeek

啟動(dòng)一個(gè)模型并進(jìn)入交互模式

ollama run phi

交互示例:

>>> who are you?
I am Phi, a large language model trained by Microsoft. I'm here to help you with any questions or tasks you have. What can I assist you with today?

查看當(dāng)前正在運(yùn)行的模型

ollama ps

輸出示例:

NAME               ID            SIZE    PROCESSOR   UNTIL
phi:latest         e2fd6321a5fe 5.4 GB  100% GPU   4 minutes from now
deepseek-r1:1.5b   a42b25d8c10a 2.0 GB  100% GPU   About a minute from now

停止一個(gè)運(yùn)行中的模型

ollama stop phi:latest

停止后再次查看:

ollama ps

輸出示例:

NAME               ID            SIZE    PROCESSOR   UNTIL
deepseek-r1:1.5b   a42b25d8c10a 2.0 GB  100% GPU   17 seconds from now

刪除一個(gè)本地模型

ollama rm phi:latest

輸出示例:

deleted 'phi:latest'

刪除后再次查看:

ollama list

輸出示例:

NAME               ID            SIZE    MODIFIED
deepseek-r1:1.5b   a42b25d8c10a 1.1 GB  42 hours ago

Ollama WebUI 部署

注意:Ollama WebUI 需要使用 Docker 啟動(dòng),如果服務(wù)器沒(méi)有安裝 Docker,需要先安裝 Docker。

創(chuàng)建數(shù)據(jù)目錄:

mkdir -p /data/ollama/webui

直接使用 docker 部署即可:

docker run -d -p 3000:8080 -e ENABLE_OPENAI_API=false -e OLLAMA_BASE_URL=http://[OLLAMA_HOST]:11434 -e HF_HUB_OFFLINE=1 -v /data/ollama/models:/root/.ollama -v /data/ollama/webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

啟動(dòng)后通過(guò)宿主機(jī)的 3000 端口訪問(wèn)即可。

Ollama 服務(wù)端常用配置

啟動(dòng) Ollama 服務(wù)端:

ollama serve

使用自定義端口啟動(dòng):

OLLAMA_HOST=0.0.0.0:11435 ollama serve

常用環(huán)境變量:

環(huán)境變量說(shuō)明默認(rèn)值
OLLAMA_DEBUG啟用調(diào)試模式,設(shè)置為 1 表示開(kāi)啟-
OLLAMA_HOST指定 Ollama 服務(wù)綁定的 IP 地址和端口127.0.0.1:11434
OLLAMA_KEEP_ALIVE設(shè)置模型在內(nèi)存中保持加載的時(shí)間5m
OLLAMA_MAX_LOADED_MODELS限制每塊 GPU 上同時(shí)加載的最大模型數(shù)量-
OLLAMA_MAX_QUEUE設(shè)置請(qǐng)求隊(duì)列的最大長(zhǎng)度,超過(guò)限制新請(qǐng)求會(huì)被拒絕-
OLLAMA_MODELS指定模型文件存儲(chǔ)的目錄路徑~/.ollama/models
OLLAMA_NUM_PARALLEL限制同時(shí)處理的最大并行請(qǐng)求數(shù)-
OLLAMA_NOPRUNE禁用啟動(dòng)時(shí)模型清理操作-
OLLAMA_ORIGINS指定允許跨域訪問(wèn)的來(lái)源列表(逗號(hào)分隔)-
OLLAMA_SCHED_SPREAD強(qiáng)制將模型調(diào)度到所有可用 GPU 上,均勻分布-
OLLAMA_FLASH_ATTENTION啟用 Flash Attention 技術(shù),硬件不支持可能報(bào)錯(cuò)-
OLLAMA_KV_CACHE_TYPE指定 K/V 緩存的量化類(lèi)型f16
OLLAMA_GPU_OVERHEAD預(yù)留顯存,防止其他進(jìn)程因顯存不足而崩潰-
OLLAMA_LOAD_TIMEOUT設(shè)置模型加載的最大超時(shí)時(shí)間(分鐘)5m

限制使用指定GPU

默認(rèn)情況下,Ollama 可以使用所有可用 GPU 進(jìn)行模型推理。如果需要限制 Ollama 只能使用特定的 GPU,可以通過(guò) CUDA_VISIBLE_DEVICES 環(huán)境變量進(jìn)行控制。

例如,限制 Ollama 只能使用 01 兩個(gè) GPU,編輯 /etc/systemd/system/ollama.service

[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_MODELS=/data/ollama/models"
Environment="CUDA_VISIBLE_DEVICES=0,1"

[Install]
WantedBy=default.target

修改完成后,重新加載配置并重啟 Ollama 服務(wù):

systemctl daemon-reload
systemctl restart ollama

進(jìn)階說(shuō)明

如果你的系統(tǒng)中搭載了多張英偉達(dá)顯卡,且希望限制 Ollama 僅使用其中部分顯卡,可將 CUDA_VISIBLE_DEVICES 設(shè)置為以逗號(hào)分隔的顯卡列表。

  • 使用數(shù)字編號(hào):可以直接使用數(shù)字編號(hào)作為顯卡標(biāo)識(shí),但編號(hào)順序可能會(huì)發(fā)生變化
  • 使用 UUID(推薦):使用 UUID 更為可靠,不會(huì)因硬件變更而改變

查看顯卡的 UUID:

nvidia-smi -L

強(qiáng)制使用 CPU 運(yùn)算:如果想忽略顯卡并強(qiáng)制 Ollama 使用 CPU 運(yùn)算,可輸入無(wú)效的顯卡編號(hào),例如:

Environment="CUDA_VISIBLE_DEVICES=-1"

到此這篇關(guān)于Ollama本地大模型安裝配置的完整流程教學(xué)的文章就介紹到這了,更多相關(guān)Ollama本地大模型安裝配置內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章,希望大家以后多多支持腳本之家!

相關(guān)文章

  • Python + Ollama 本地跑大模型:零成本搭建你的私有 AI 助手

    文章介紹Ollama本地AI助手的安裝方法,從環(huán)境準(zhǔn)備、快速上手到實(shí)戰(zhàn)項(xiàng)目,并探討了其核心優(yōu)勢(shì),包括零成本、零數(shù)據(jù)風(fēng)險(xiǎn)、零門(mén)檻和零妥協(xié),通過(guò)使用Ollama,用戶可以在本地運(yùn)行大
    2026-04-09
  • 三種快速安裝下載OLLAMA的方法小結(jié)(任何版本都適用)

    本文主要介紹了三種快速下載OLLAMA的方法小結(jié),文中通過(guò)圖文步驟介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2026-03-31
  • ollama本地部署DeepSeek教程的實(shí)現(xiàn)

    本文主要介紹如何使用ollama本地部署deepseek大模型,以及使用WebUI工具界面進(jìn)行交互,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需
    2026-03-31
  • Docker部署Ollama搭建本地AI開(kāi)發(fā)環(huán)境

    本文介紹如何通過(guò)Docker+Ollama搭建本地AI開(kāi)發(fā)環(huán)境,解決云端API調(diào)用成本高、延遲大的問(wèn)題,幫助開(kāi)發(fā)者快速實(shí)現(xiàn)本地AI應(yīng)用開(kāi)發(fā),無(wú)需擔(dān)心API調(diào)用限制和費(fèi)用問(wèn)題,感興趣的可
    2026-03-30
  • Windows11下Ollama部署Qwen2.5大模型的實(shí)戰(zhàn)指南

    本文旨在記錄 如何在Windows 11 本地環(huán)境下,利用 Ollama 部署 Qwen2.5 大模型,并實(shí)現(xiàn) API 調(diào)用,無(wú)需顯卡也能跑”、能夠確保隱私安全,有需要的小伙伴可以跟隨小編一起了解
    2026-03-18
  • Ollama 模型交互的三種方式介紹

    與 Ollama 模型交互是使用大語(yǔ)言模型(LLM)進(jìn)行對(duì)話、生成文本或執(zhí)行任務(wù)的核心功能,Ollama 提供兩種主要交互方式:通過(guò)命令行界面(CLI)的交互式終端和通過(guò) REST API 的
    2026-03-09
  • Ollama 模型交互基礎(chǔ)篇

    Ollama 提供了多種方式與模型進(jìn)行交互,其中最常見(jiàn)的就是通過(guò)命令行進(jìn)行推理操作
    2026-03-09

最新評(píng)論

连平县| 天台县| 高阳县| 太和县| 新巴尔虎左旗| 济阳县| 延庆县| 巴林左旗| 桦川县| 内江市| 承德县| 开封市| 玛曲县| 依安县| 德钦县| 巍山| 拉孜县| 闽清县| 图木舒克市| 葵青区| 凉山| 增城市| 乐清市| 翁牛特旗| 金塔县| 香港 | 正阳县| 灵山县| 溆浦县| 乐平市| 宿迁市| 建德市| 忻城县| 合川市| 独山县| 镶黄旗| 广南县| 金溪县| 额敏县| 嘉定区| 定结县|