派大星:本地部署大模型原来这么简单!

对于本地部署大语言模型,最适合的推理引擎便是llamacpp了,依照官方文档,想要快速安装llama并部署模型非常简单。

不建议使用官方安装脚本,版本较旧推理速度慢

我们需要到llamacpp的官方github仓库的releases中找到最新的构建版本

找到最新的release下滑找到assets并展开,能看到提供了非常多的构建版本

Release 页面里的文件是同一套程序针对不同平台和硬件编译的版本。

文件名一般可以这样看:

llama-b10712-bin-win-cuda-13.3-x64.zip

b10712:llama.cpp 的构建编号,不是模型版本

win:Windows 平台

cuda-13.3:使用 NVIDIA 显卡的 CUDA 加速

x64:Intel 或 AMD 的普通 64 位电脑

最简单的选择原则:

Windows + NVIDIA 显卡:选 win-cuda-xx.x-x64

Windows + AMD/Intel 显卡:选 win-vulkan-x64

Windows 没有可用独显:选 win-cpu-x64

使用cuda时需要确保你的电脑已经安装有cuda环境

我这里选择使用 llama-b10712-bin-win-cuda-13.3-x64.zip 下载并解压。

之后你需要一个模型权重,我这边选择使用 gemma-4-26B-A4B-it-GGUF 模型,GGUF是llama所使用的一种格式,可以在huggingface或modelscope社区下载

gemma-4-26B-A4B-it

Gemma 4:Google 的 Gemma 4 系列

26B:约 260 亿总参数

A4B:每次推理约激活 40 亿参数

it:指令微调版,适合直接聊天、问答

量化等级:

BF16:接近原始精度,文件最大,对显存和内存要求最高

Q8_0:8 位量化,质量较高,体积约为 BF16 的一半

Q4_0:4 位量化,体积更小,适合本地运行,质量会略降

mmproj 是视觉模块,加载时和主模型一起使用;纯文字聊天不需要它。

mtp 和 dflash 都是“草稿模型”,不能单独对话。它们与主模型配合,通过推测解码提高生成速度,但需要新版 llama.cpp、额外显存,并且配置更复杂。普通用户先忽略它们即可。

我的配置是32GB RAM + 4060laptop,这边选择下载

gemma-4-26B-A4B-it-Q4_0.gguf

mmproj-gemma-4-26B-A4B-it-Q8_0.gguf

由于mmproj没有提供Q4版本,这里我选择Q8版本,也是能用的。

下载好模型与llama之后,将其放置到一块,然后打开终端定位到该目录

.\llama-b10712-bin-win-cuda-13.3-x64\llama.exe server -m .\gemma-4-26B-A4B-it-Q4_0.gguf --mmproj .\mmproj-gemma-4-26B-A4B-it-Q8_0.gguf

这里表示使用.\llama-b10712-bin-win-cuda-13.3-x64\llama.exe运行server模式,-m加载指定模型,--mmproj指定加载视觉模块。

浏览器中访问这个地址

llama提供标准的openai completions接口与anthropic接口,接下来可以将我们的本地模型接入到任何平台中!

mitacore是一款简单且轻量的叙事陪伴型的聊天agent,我们在模型管理界面中新增一个供应商

接口类型选择openai completions,地址如图所示,使用默认8080端口,apikey由于没有设置,这里填写任意内容即可,之后点击“获取模型按钮”就能获取到我们本地部署的模型列表啦。

将模型分工都配置为我们本地部署的gemma-4-26B-A4B模型,保存配置后重启服务!

向模型发送消息后收到了错误,原因是默认设置的最大tokens为4096,而实际接收到10379 tokens。

将通过-c 128000将上下文窗口设置到128k后重新启动。

经过漫长的等待,终于迎来了输出

文章小结:

本地部署大模型并没有任何实用价值,本教程仅供娱乐参考使用,切勿较真。

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com