VoxCPM2 上線,最強開源聲音模型技術解析。

大家好呀,上次更新是一週以前了,

因爲都在忙着畢業設計。。。(已經活人微死了)

這幾天逛 Hugging Face 的時候,又看到了 VoxCPM

它更新了,還一躍飆升至了第二名。

(前三名都是國產的,有一說一,國產模型在開源這塊全世界真的可以說是第一了。)


VoxCPM1 的技術分享我在黑盒也寫了篇文章:

VoxCPM1 技術解析

然後是我最激動的,這個版本支持克隆/生成的語言超多,足足有 30 種

阿拉伯語、緬甸語、中文、丹麥語、荷蘭語、英語、芬蘭語、法語....

中國方言:四川話、粵語、吳語、東北話、河南話、陝西話、山東話、天津話、閩南話

好傢伙,1.5只支持中英雙語,VoxCPM2一口氣加了這麼多,牛逼。

而且支持中國本土方言的數量也變多了,

這個,絕對是很多用戶想要的,

不然只支持四川粵語東北話這三種方言多沒意思。

吹水完畢,直接給大家看看克隆效果。

有兩種模式,一種是人聲克隆,還有一種是文生音頻。

前者的效果極好,甚至可以以假亂真。後者需要調提示詞抽卡,但更多樣化。

對比視頻在此:

(懶得把視頻再放 B 站上傳一遍了,直接放原視頻鏈接)

https://mp.weixin.qq.com/s/5daK6F3cufrILxtdsF-Lhg

我還發現一個邪修,就是方言生成,

沒法用普通話文本,需要用方言文本 官方也給了案例:

“廣東話Control Instruction: 粵語,中年男性,語氣平淡" ✅ 正確(粵語表達):"夥計,唔該一個A餐,凍奶茶少甜!" ❌ 錯誤(普通話原文):"夥計,麻煩來一個A餐,凍奶茶少甜!” 

這時候就可以讓國產原生的豆包來幫助我們進行【中譯中】

現在我們再來聊聊技術:

與將語音轉爲離散 token 的主流 TTS 不同,VoxCPM 採用端到端架構,從文本 直接生成連續語音表示。

系統以 MiniCPM 爲骨幹,結合分層語言建模與 FSQ 約束的連續潛變量,將高層語義規劃與低層聲學渲染分離開來。

VoxCPM 2 保持四階段整體結構不變,但重新設計了若干內部信息流路徑。使得表現力、可控性與輸出質量大大提升。

在 VoxCPM 1.0、1.5 與 2 上,系列共用同一條高層生成路徑:

文本 → 四階段生成流水線 → AudioVAE 解碼器 → 波形

生成的潛變量再由 AudioVAE 解碼爲原始波形。

AudioVAE 是圍繞生成骨幹的配套編解碼組件:訓練時提供潛表示,推理時將預測的潛變量還原爲波形採樣。

VoxCPM 的共享架構由三項設計選擇共同塑造:

  • 無分詞器的連續建模可保留細粒度聲學細節,而非把語音壓縮爲離散 token。

  • 分層語義–聲學分離使模型將高層規劃與低層渲染分開處理。

  • Patch 級自迴歸生成可縮短序列長度,幫助系統擴展到更長文本和更快的合成設置。


現在來說 VoxCPM2 的創新點:

殘差聲學 LM 融合

VoxCPM 以前版本在融合語義模型輸出和局部聲學特徵時,Residual Acoustic LM 採用簡單的相加方式。VoxCPM 2 則改爲先拼接,再經可學習投影。

這使模型能更自由地決定語義意圖與聲學證據如何交互,而不必通過逐元素加法強行壓入同一表示。在實踐中,這有助於更豐富的聲學細節與更強的表現力。


局部 DiT 條件控制

負責最終生成的 Local DIT 模塊,是在每個音頻 patch 內工作的擴散 Transformer,以前只接收一個單一的融合條件信號。現在的新版本改爲向變壓器提供來自語義和聲學路徑的多詞元(Token)條件前綴 。

這種設計避免了過早融合導致的信息坍縮,讓 Local DIT 在內部注意力機制中保留了更多信息,從而讓最終的聲音生成階段更具表現力,也更具可控性。


隔離式參考音頻通道

在以前,聲音克隆主要通過 prompt 續寫來實現。現在,VoxCPM2 增加了一個結構上獨立的參考音頻通道。這樣就把音色參考和續寫的上下文分開了,讓僅參考聲音克隆的行爲變得更強,也更容易把聲音身份控制和其他生成模式結合起來 。


新的 AudioVAE V2 採用了非對稱的編解碼設計,它能以 16kHz 的採樣率進行特徵編碼,卻直接以 48kHz 的超高清採樣率進行解碼輸出。

這意味着,機器生成的語音頻率響應範圍更廣,輸出的音質能夠接近專業錄音室的標準。

最關鍵的是,這個高清音質的提升,並不需要同比拉長模型處理的信息序列長度,也不需要單獨進行上採樣級處理,真正做到了高效和保真並存 。

另外模型容量也擴展,基礎音頻塊的尺寸被統一設定爲 4。

殘差聲學語言模型的網絡深度從 6 層加深到了 8 層。

有限標量量化模塊的潛變量維度也從 256 擴容至 512。

這樣就能允許系統處理更大規模數據以及更復雜的語音生成任務。

之前挺早就開始用 VoxCPM 了,

免費還開源,這幾天還在用 VoxCPM2 來給短片配音,

狠狠讚了。

想用的話,可以去 GitHub 或者抱抱臉上面直接搜,有在線免費使用版。

曉風乾丨 大四 Base北京 AI產品在職

想縮小科技帶來的信息差 分享很酷的AI玩法。

希望得到您的點贊轉發愛心三連支持。

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com