大家好呀,上次更新是一週以前了,
因爲都在忙着畢業設計。。。(已經活人微死了)
這幾天逛 Hugging Face 的時候,又看到了 VoxCPM,
它更新了,還一躍飆升至了第二名。
![]()
(前三名都是國產的,有一說一,國產模型在開源這塊全世界真的可以說是第一了。)
VoxCPM1 的技術分享我在黑盒也寫了篇文章:
然後是我最激動的,這個版本支持克隆/生成的語言超多,足足有 30 種
阿拉伯語、緬甸語、中文、丹麥語、荷蘭語、英語、芬蘭語、法語....
中國方言:四川話、粵語、吳語、東北話、河南話、陝西話、山東話、天津話、閩南話
![]()
好傢伙,1.5只支持中英雙語,VoxCPM2一口氣加了這麼多,牛逼。
而且支持中國本土方言的數量也變多了,
這個,絕對是很多用戶想要的,
不然只支持四川粵語東北話這三種方言多沒意思。
吹水完畢,直接給大家看看克隆效果。
有兩種模式,一種是人聲克隆,還有一種是文生音頻。
前者的效果極好,甚至可以以假亂真。後者需要調提示詞抽卡,但更多樣化。
對比視頻在此:
(懶得把視頻再放 B 站上傳一遍了,直接放原視頻鏈接)
https://mp.weixin.qq.com/s/5daK6F3cufrILxtdsF-Lhg
我還發現一個邪修,就是方言生成,
沒法用普通話文本,需要用方言文本 官方也給了案例:
“廣東話Control Instruction: 粵語,中年男性,語氣平淡" ✅ 正確(粵語表達):"夥計,唔該一個A餐,凍奶茶少甜!" ❌ 錯誤(普通話原文):"夥計,麻煩來一個A餐,凍奶茶少甜!”
這時候就可以讓國產原生的豆包來幫助我們進行【中譯中】
![]()
![]()
現在我們再來聊聊技術:
與將語音轉爲離散 token 的主流 TTS 不同,VoxCPM 採用端到端架構,從文本 直接生成連續語音表示。
系統以 MiniCPM 爲骨幹,結合分層語言建模與 FSQ 約束的連續潛變量,將高層語義規劃與低層聲學渲染分離開來。
![]()
VoxCPM 2 保持四階段整體結構不變,但重新設計了若干內部信息流路徑。使得表現力、可控性與輸出質量大大提升。
在 VoxCPM 1.0、1.5 與 2 上,系列共用同一條高層生成路徑:
文本 → 四階段生成流水線 → AudioVAE 解碼器 → 波形

生成的潛變量再由 AudioVAE 解碼爲原始波形。
AudioVAE 是圍繞生成骨幹的配套編解碼組件:訓練時提供潛表示,推理時將預測的潛變量還原爲波形採樣。
![]()
VoxCPM 的共享架構由三項設計選擇共同塑造:
無分詞器的連續建模可保留細粒度聲學細節,而非把語音壓縮爲離散 token。
分層語義–聲學分離使模型將高層規劃與低層渲染分開處理。
Patch 級自迴歸生成可縮短序列長度,幫助系統擴展到更長文本和更快的合成設置。
![]()
現在來說 VoxCPM2 的創新點:
殘差聲學 LM 融合
VoxCPM 以前版本在融合語義模型輸出和局部聲學特徵時,Residual Acoustic LM 採用簡單的相加方式。VoxCPM 2 則改爲先拼接,再經可學習投影。
這使模型能更自由地決定語義意圖與聲學證據如何交互,而不必通過逐元素加法強行壓入同一表示。在實踐中,這有助於更豐富的聲學細節與更強的表現力。
![]()
局部 DiT 條件控制
負責最終生成的 Local DIT 模塊,是在每個音頻 patch 內工作的擴散 Transformer,以前只接收一個單一的融合條件信號。現在的新版本改爲向變壓器提供來自語義和聲學路徑的多詞元(Token)條件前綴 。
這種設計避免了過早融合導致的信息坍縮,讓 Local DIT 在內部注意力機制中保留了更多信息,從而讓最終的聲音生成階段更具表現力,也更具可控性。

隔離式參考音頻通道
在以前,聲音克隆主要通過 prompt 續寫來實現。現在,VoxCPM2 增加了一個結構上獨立的參考音頻通道。這樣就把音色參考和續寫的上下文分開了,讓僅參考聲音克隆的行爲變得更強,也更容易把聲音身份控制和其他生成模式結合起來 。
![]()
新的 AudioVAE V2 採用了非對稱的編解碼設計,它能以 16kHz 的採樣率進行特徵編碼,卻直接以 48kHz 的超高清採樣率進行解碼輸出。
這意味着,機器生成的語音頻率響應範圍更廣,輸出的音質能夠接近專業錄音室的標準。
最關鍵的是,這個高清音質的提升,並不需要同比拉長模型處理的信息序列長度,也不需要單獨進行上採樣級處理,真正做到了高效和保真並存 。
![]()
另外模型容量也擴展,基礎音頻塊的尺寸被統一設定爲 4。
殘差聲學語言模型的網絡深度從 6 層加深到了 8 層。
有限標量量化模塊的潛變量維度也從 256 擴容至 512。
這樣就能允許系統處理更大規模數據以及更復雜的語音生成任務。
之前挺早就開始用 VoxCPM 了,
免費還開源,這幾天還在用 VoxCPM2 來給短片配音,
狠狠讚了。
想用的話,可以去 GitHub 或者抱抱臉上面直接搜,有在線免費使用版。
曉風乾丨 大四 Base北京 AI產品在職
想縮小科技帶來的信息差 分享很酷的AI玩法。
希望得到您的點贊轉發愛心三連支持。
更多遊戲資訊請關註:電玩幫遊戲資訊專區
電玩幫圖文攻略 www.vgover.com
