對於本地部署大語言模型,最適合的推理引擎便是llamacpp了,依照官方文檔,想要快速安裝llama並部署模型非常簡單。
![]()
不建議使用官方安裝腳本,版本較舊推理速度慢
我們需要到llamacpp的官方github倉庫的releases中找到最新的構建版本
![]()
找到最新的release下滑找到assets並展開,能看到提供了非常多的構建版本
![]()
Release 頁面裏的文件是同一套程序針對不同平臺和硬件編譯的版本。
文件名一般可以這樣看:
llama-b10712-bin-win-cuda-13.3-x64.zip
b10712:llama.cpp 的構建編號,不是模型版本
win:Windows 平臺
cuda-13.3:使用 NVIDIA 顯卡的 CUDA 加速
x64:Intel 或 AMD 的普通 64 位電腦
最簡單的選擇原則:
Windows + NVIDIA 顯卡:選 win-cuda-xx.x-x64
Windows + AMD/Intel 顯卡:選 win-vulkan-x64
Windows 沒有可用獨顯:選 win-cpu-x64
使用cuda時需要確保你的電腦已經安裝有cuda環境
![]()
![]()
我這裏選擇使用 llama-b10712-bin-win-cuda-13.3-x64.zip 下載並解壓。
之後你需要一個模型權重,我這邊選擇使用 gemma-4-26B-A4B-it-GGUF 模型,GGUF是llama所使用的一種格式,可以在huggingface或modelscope社區下載
![]()
gemma-4-26B-A4B-it
Gemma 4:Google 的 Gemma 4 系列
26B:約 260 億總參數
A4B:每次推理約激活 40 億參數
it:指令微調版,適合直接聊天、問答
量化等級:
BF16:接近原始精度,文件最大,對顯存和內存要求最高
Q8_0:8 位量化,質量較高,體積約爲 BF16 的一半
Q4_0:4 位量化,體積更小,適合本地運行,質量會略降
mmproj 是視覺模塊,加載時和主模型一起使用;純文字聊天不需要它。
mtp 和 dflash 都是“草稿模型”,不能單獨對話。它們與主模型配合,通過推測解碼提高生成速度,但需要新版 llama.cpp、額外顯存,並且配置更復雜。普通用戶先忽略它們即可。
我的配置是32GB RAM + 4060laptop,這邊選擇下載
gemma-4-26B-A4B-it-Q4_0.gguf
mmproj-gemma-4-26B-A4B-it-Q8_0.gguf
由於mmproj沒有提供Q4版本,這裏我選擇Q8版本,也是能用的。
![]()
下載好模型與llama之後,將其放置到一塊,然後打開終端定位到該目錄
![]()
.\llama-b10712-bin-win-cuda-13.3-x64\llama.exe server -m .\gemma-4-26B-A4B-it-Q4_0.gguf --mmproj .\mmproj-gemma-4-26B-A4B-it-Q8_0.gguf
這裏表示使用.\llama-b10712-bin-win-cuda-13.3-x64\llama.exe運行server模式,-m加載指定模型,--mmproj指定加載視覺模塊。
![]()
瀏覽器中訪問這個地址
![]()
llama提供標準的openai completions接口與anthropic接口,接下來可以將我們的本地模型接入到任何平臺中!
mitacore是一款簡單且輕量的敘事陪伴型的聊天agent,我們在模型管理界面中新增一個供應商
![]()
接口類型選擇openai completions,地址如圖所示,使用默認8080端口,apikey由於沒有設置,這裏填寫任意內容即可,之後點擊“獲取模型按鈕”就能獲取到我們本地部署的模型列表啦。
![]()
將模型分工都配置爲我們本地部署的gemma-4-26B-A4B模型,保存配置後重啓服務!
![]()
向模型發送消息後收到了錯誤,原因是默認設置的最大tokens爲4096,而實際接收到10379 tokens。
![]()
將通過-c 128000將上下文窗口設置到128k後重新啓動。
![]()
經過漫長的等待,終於迎來了輸出
![]()
文章小結:
本地部署大模型並沒有任何實用價值,本教程僅供娛樂參考使用,切勿較真。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
