VoxCPM2 上线,最强开源声音模型技术解析。

大家好呀,上次更新是一周以前了,

因为都在忙着毕业设计。。。(已经活人微死了)

这几天逛 Hugging Face 的时候,又看到了 VoxCPM

它更新了,还一跃飙升至了第二名。

(前三名都是国产的,有一说一,国产模型在开源这块全世界真的可以说是第一了。)


VoxCPM1 的技术分享我在黑盒也写了篇文章:

VoxCPM1 技术解析

然后是我最激动的,这个版本支持克隆/生成的语言超多,足足有 30 种

阿拉伯语、缅甸语、中文、丹麦语、荷兰语、英语、芬兰语、法语....

中国方言:四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话

好家伙,1.5只支持中英双语,VoxCPM2一口气加了这么多,牛逼。

而且支持中国本土方言的数量也变多了,

这个,绝对是很多用户想要的,

不然只支持四川粤语东北话这三种方言多没意思。

吹水完毕,直接给大家看看克隆效果。

有两种模式,一种是人声克隆,还有一种是文生音频。

前者的效果极好,甚至可以以假乱真。后者需要调提示词抽卡,但更多样化。

对比视频在此:

(懒得把视频再放 B 站上传一遍了,直接放原视频链接)

https://mp.weixin.qq.com/s/5daK6F3cufrILxtdsF-Lhg

我还发现一个邪修,就是方言生成,

没法用普通话文本,需要用方言文本 官方也给了案例:

“广东话Control Instruction: 粤语,中年男性,语气平淡" ✅ 正确(粤语表达):"伙計,唔該一個A餐,凍奶茶少甜!" ❌ 错误(普通话原文):"伙计,麻烦来一个A餐,冻奶茶少甜!” 

这时候就可以让国产原生的豆包来帮助我们进行【中译中】

现在我们再来聊聊技术:

与将语音转为离散 token 的主流 TTS 不同,VoxCPM 采用端到端架构,从文本 直接生成连续语音表示。

系统以 MiniCPM 为骨干,结合分层语言建模与 FSQ 约束的连续潜变量,将高层语义规划与低层声学渲染分离开来。

VoxCPM 2 保持四阶段整体结构不变,但重新设计了若干内部信息流路径。使得表现力、可控性与输出质量大大提升。

在 VoxCPM 1.0、1.5 与 2 上,系列共用同一条高层生成路径:

文本 → 四阶段生成流水线 → AudioVAE 解码器 → 波形

生成的潜变量再由 AudioVAE 解码为原始波形。

AudioVAE 是围绕生成骨干的配套编解码组件:训练时提供潜表示,推理时将预测的潜变量还原为波形采样。

VoxCPM 的共享架构由三项设计选择共同塑造:

  • 无分词器的连续建模可保留细粒度声学细节,而非把语音压缩为离散 token。

  • 分层语义–声学分离使模型将高层规划与低层渲染分开处理。

  • Patch 级自回归生成可缩短序列长度,帮助系统扩展到更长文本和更快的合成设置。


现在来说 VoxCPM2 的创新点:

残差声学 LM 融合

VoxCPM 以前版本在融合语义模型输出和局部声学特征时,Residual Acoustic LM 采用简单的相加方式。VoxCPM 2 则改为先拼接,再经可学习投影。

这使模型能更自由地决定语义意图与声学证据如何交互,而不必通过逐元素加法强行压入同一表示。在实践中,这有助于更丰富的声学细节与更强的表现力。


局部 DiT 条件控制

负责最终生成的 Local DIT 模块,是在每个音频 patch 内工作的扩散 Transformer,以前只接收一个单一的融合条件信号。现在的新版本改为向变压器提供来自语义和声学路径的多词元(Token)条件前缀 。

这种设计避免了过早融合导致的信息坍缩,让 Local DIT 在内部注意力机制中保留了更多信息,从而让最终的声音生成阶段更具表现力,也更具可控性。


隔离式参考音频通道

在以前,声音克隆主要通过 prompt 续写来实现。现在,VoxCPM2 增加了一个结构上独立的参考音频通道。这样就把音色参考和续写的上下文分开了,让仅参考声音克隆的行为变得更强,也更容易把声音身份控制和其他生成模式结合起来 。


新的 AudioVAE V2 采用了非对称的编解码设计,它能以 16kHz 的采样率进行特征编码,却直接以 48kHz 的超高清采样率进行解码输出。

这意味着,机器生成的语音频率响应范围更广,输出的音质能够接近专业录音室的标准。

最关键的是,这个高清音质的提升,并不需要同比拉长模型处理的信息序列长度,也不需要单独进行上采样级处理,真正做到了高效和保真并存 。

另外模型容量也扩展,基础音频块的尺寸被统一设定为 4。

残差声学语言模型的网络深度从 6 层加深到了 8 层。

有限标量量化模块的潜变量维度也从 256 扩容至 512。

这样就能允许系统处理更大规模数据以及更复杂的语音生成任务。

之前挺早就开始用 VoxCPM 了,

免费还开源,这几天还在用 VoxCPM2 来给短片配音,

狠狠赞了。

想用的话,可以去 GitHub 或者抱抱脸上面直接搜,有在线免费使用版。

晓风乾丨 大四 Base北京 AI产品在职

想缩小科技带来的信息差 分享很酷的AI玩法。

希望得到您的点赞转发爱心三连支持。

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com