对于本地部署大语言模型,最适合的推理引擎便是llamacpp了,依照官方文档,想要快速安装llama并部署模型非常简单。
![]()
不建议使用官方安装脚本,版本较旧推理速度慢
我们需要到llamacpp的官方github仓库的releases中找到最新的构建版本
![]()
找到最新的release下滑找到assets并展开,能看到提供了非常多的构建版本
![]()
Release 页面里的文件是同一套程序针对不同平台和硬件编译的版本。
文件名一般可以这样看:
llama-b10712-bin-win-cuda-13.3-x64.zip
b10712:llama.cpp 的构建编号,不是模型版本
win:Windows 平台
cuda-13.3:使用 NVIDIA 显卡的 CUDA 加速
x64:Intel 或 AMD 的普通 64 位电脑
最简单的选择原则:
Windows + NVIDIA 显卡:选 win-cuda-xx.x-x64
Windows + AMD/Intel 显卡:选 win-vulkan-x64
Windows 没有可用独显:选 win-cpu-x64
使用cuda时需要确保你的电脑已经安装有cuda环境
![]()
![]()
我这里选择使用 llama-b10712-bin-win-cuda-13.3-x64.zip 下载并解压。
之后你需要一个模型权重,我这边选择使用 gemma-4-26B-A4B-it-GGUF 模型,GGUF是llama所使用的一种格式,可以在huggingface或modelscope社区下载
![]()
gemma-4-26B-A4B-it
Gemma 4:Google 的 Gemma 4 系列
26B:约 260 亿总参数
A4B:每次推理约激活 40 亿参数
it:指令微调版,适合直接聊天、问答
量化等级:
BF16:接近原始精度,文件最大,对显存和内存要求最高
Q8_0:8 位量化,质量较高,体积约为 BF16 的一半
Q4_0:4 位量化,体积更小,适合本地运行,质量会略降
mmproj 是视觉模块,加载时和主模型一起使用;纯文字聊天不需要它。
mtp 和 dflash 都是“草稿模型”,不能单独对话。它们与主模型配合,通过推测解码提高生成速度,但需要新版 llama.cpp、额外显存,并且配置更复杂。普通用户先忽略它们即可。
我的配置是32GB RAM + 4060laptop,这边选择下载
gemma-4-26B-A4B-it-Q4_0.gguf
mmproj-gemma-4-26B-A4B-it-Q8_0.gguf
由于mmproj没有提供Q4版本,这里我选择Q8版本,也是能用的。
![]()
下载好模型与llama之后,将其放置到一块,然后打开终端定位到该目录
![]()
.\llama-b10712-bin-win-cuda-13.3-x64\llama.exe server -m .\gemma-4-26B-A4B-it-Q4_0.gguf --mmproj .\mmproj-gemma-4-26B-A4B-it-Q8_0.gguf
这里表示使用.\llama-b10712-bin-win-cuda-13.3-x64\llama.exe运行server模式,-m加载指定模型,--mmproj指定加载视觉模块。
![]()
浏览器中访问这个地址
![]()
llama提供标准的openai completions接口与anthropic接口,接下来可以将我们的本地模型接入到任何平台中!
mitacore是一款简单且轻量的叙事陪伴型的聊天agent,我们在模型管理界面中新增一个供应商
![]()
接口类型选择openai completions,地址如图所示,使用默认8080端口,apikey由于没有设置,这里填写任意内容即可,之后点击“获取模型按钮”就能获取到我们本地部署的模型列表啦。
![]()
将模型分工都配置为我们本地部署的gemma-4-26B-A4B模型,保存配置后重启服务!
![]()
向模型发送消息后收到了错误,原因是默认设置的最大tokens为4096,而实际接收到10379 tokens。
![]()
将通过-c 128000将上下文窗口设置到128k后重新启动。
![]()
经过漫长的等待,终于迎来了输出
![]()
文章小结:
本地部署大模型并没有任何实用价值,本教程仅供娱乐参考使用,切勿较真。
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
