派大星:本地部署大模型原來這麼簡單!

對於本地部署大語言模型,最適合的推理引擎便是llamacpp了,依照官方文檔,想要快速安裝llama並部署模型非常簡單。

不建議使用官方安裝腳本,版本較舊推理速度慢

我們需要到llamacpp的官方github倉庫的releases中找到最新的構建版本

找到最新的release下滑找到assets並展開,能看到提供了非常多的構建版本

Release 頁面裏的文件是同一套程序針對不同平臺和硬件編譯的版本。

文件名一般可以這樣看:

llama-b10712-bin-win-cuda-13.3-x64.zip

b10712:llama.cpp 的構建編號,不是模型版本

win:Windows 平臺

cuda-13.3:使用 NVIDIA 顯卡的 CUDA 加速

x64:Intel 或 AMD 的普通 64 位電腦

最簡單的選擇原則:

Windows + NVIDIA 顯卡:選 win-cuda-xx.x-x64

Windows + AMD/Intel 顯卡:選 win-vulkan-x64

Windows 沒有可用獨顯:選 win-cpu-x64

使用cuda時需要確保你的電腦已經安裝有cuda環境

我這裏選擇使用 llama-b10712-bin-win-cuda-13.3-x64.zip 下載並解壓。

之後你需要一個模型權重,我這邊選擇使用 gemma-4-26B-A4B-it-GGUF 模型,GGUF是llama所使用的一種格式,可以在huggingface或modelscope社區下載

gemma-4-26B-A4B-it

Gemma 4:Google 的 Gemma 4 系列

26B:約 260 億總參數

A4B:每次推理約激活 40 億參數

it:指令微調版,適合直接聊天、問答

量化等級:

BF16:接近原始精度,文件最大,對顯存和內存要求最高

Q8_0:8 位量化,質量較高,體積約爲 BF16 的一半

Q4_0:4 位量化,體積更小,適合本地運行,質量會略降

mmproj 是視覺模塊,加載時和主模型一起使用;純文字聊天不需要它。

mtp 和 dflash 都是“草稿模型”,不能單獨對話。它們與主模型配合,通過推測解碼提高生成速度,但需要新版 llama.cpp、額外顯存,並且配置更復雜。普通用戶先忽略它們即可。

我的配置是32GB RAM + 4060laptop,這邊選擇下載

gemma-4-26B-A4B-it-Q4_0.gguf

mmproj-gemma-4-26B-A4B-it-Q8_0.gguf

由於mmproj沒有提供Q4版本,這裏我選擇Q8版本,也是能用的。

下載好模型與llama之後,將其放置到一塊,然後打開終端定位到該目錄

.\llama-b10712-bin-win-cuda-13.3-x64\llama.exe server -m .\gemma-4-26B-A4B-it-Q4_0.gguf --mmproj .\mmproj-gemma-4-26B-A4B-it-Q8_0.gguf

這裏表示使用.\llama-b10712-bin-win-cuda-13.3-x64\llama.exe運行server模式,-m加載指定模型,--mmproj指定加載視覺模塊。

瀏覽器中訪問這個地址

llama提供標準的openai completions接口與anthropic接口,接下來可以將我們的本地模型接入到任何平臺中!

mitacore是一款簡單且輕量的敘事陪伴型的聊天agent,我們在模型管理界面中新增一個供應商

接口類型選擇openai completions,地址如圖所示,使用默認8080端口,apikey由於沒有設置,這裏填寫任意內容即可,之後點擊“獲取模型按鈕”就能獲取到我們本地部署的模型列表啦。

將模型分工都配置爲我們本地部署的gemma-4-26B-A4B模型,保存配置後重啓服務!

向模型發送消息後收到了錯誤,原因是默認設置的最大tokens爲4096,而實際接收到10379 tokens。

將通過-c 128000將上下文窗口設置到128k後重新啓動。

經過漫長的等待,終於迎來了輸出

文章小結:

本地部署大模型並沒有任何實用價值,本教程僅供娛樂參考使用,切勿較真。

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com