如何用AI翻唱自己喜歡的歌曲?(基礎篇)【0成本】

上一期的AI經歷引發了很多人的關注和點贊,很多盒友也展現了很濃的興趣。

https://api.xiaoheihe.cn/v3/bbs/app/api/web/share?h_camp=link&h_src=YXBwX3NoYXJl&link_id=77657206a38b

看到了很多同齡人的經歷,爲了幫助大家很容易上手學習AI,我開始決定無償幫助大家,從0開始學習不同AI工具和知識,並且相互結合。

爲了不讓教學過程很乾燥,我決定用比較有趣內容進行教學。

注意:本人不賣課!不推軟件會員!

如果是爲了賺盒友的錢,天打雷劈

在給大家教學的過程中也在鞭策自己學更多的AI知識,這樣才能繼續給大家當老師了,哈哈。

廢話不多說了,咱們直接聽成片曲:

  • 今天要學的是,“0成本”如何用AI翻唱自己喜歡的歌曲?(基礎篇)

教學目錄

一、下載歌曲

二、翻唱原理

三、需要部署的模型

四、完整步驟

一、下載歌曲

首先,先要挑好咱們自己想要更改的歌曲,可以去網上下載,也可以在客戶端下載(QQ音樂、網易雲)。

但是某些下載後的歌曲可能並不是MP3等格式,無法正常打開,只能通過原客戶端打開。

這裏可以使用開源的網站,將網易雲下載的特殊格式的音樂變成正常格式:

https://convert.freelrc.com/NCM-to-MP3

免費無需登錄

二、翻唱原理

原理很簡單:

  • 下載好的歌曲→人聲+背景音

然後通過訓練好的音域模型,一鍵替換人聲即可,再把背景音拿回來組合一下就行。

比如:主唱的歌詞部分爲人聲,而彈奏的吉他、貝斯、鋼琴等樂器、伴奏都屬於背景音。

要注意的是下面的步驟:

  • 人聲→“幹聲”+和聲+混響

但是,咱們要替換的只是人聲的幹聲部分,還要剔除掉“和聲”和“混響”

什麼是和聲?就是不同的音同時發聲,得去除掉!

如果不去除和聲和混響,就會導致替換後的幹音出現啞音多,或者不準確的問題。

三、需要部署的模型

我的教程中會需要下載兩個本地開源模型,兩個加起來大概20G左右,都是無需登錄無需使用會員的開源大模型(均在Github上能下載到)

1.UVR5

UVR5的本地部署,是爲了讓我們分離下載歌曲的“人聲+背景聲”,這一步是非常關鍵的。

雖然很多軟件也能分離人聲和背景音,但是我們還需要進行消除“和聲和混響”,這個軟件是全球最強的分離模型,毋庸置疑。

Github下載UVR5地址(最好用谷歌瀏覽器,原本瀏覽器會卡進度):

https://github.com/Anjok07/ultimatevocalremovergui/releases/tag/v5.6

2.RVC(至少8G顯存)

這個音域大模型首先幫助我們訓練想要的聲音,比如開頭的烏魯魯,通過多輪學習之後就可以用來改任何一切的歌曲。(顯卡算力越強越快)

其次,用訓練好的烏魯魯模型一鍵替換人聲,就可以使其達到翻唱的效果!

這裏是下載鏈接[根據自己的顯卡去下載](最好用谷歌瀏覽器,原本瀏覽器會卡進度)

www.yuque.com/flowercry/hxf0ds

兩個都在本地下載好部署之後,就開始咱們今天的教學了。

四、完整步驟

1.分離人聲+背景音→分離幹聲

打開UVR5,咱們開始分離下載好的歌曲,將歌曲分成“人聲+背景音”。

將歌曲拖進第一行,然後,第二行選擇一個保存的路徑即可。

然後使用MDX-Net,根據我的設置即可,輸出的音頻WAV最清晰,然後有顯卡的話就勾選GPU這個選項工作,沒有就不勾選。

  • 點擊下方的start

等待UVR5這個模型處理完之後,在保存的路徑上就有兩個文件,“1個人聲+1個背景音”。

  • 接下來進行:

人聲→去除和聲/回聲

將人聲拖進去,咱們開始去除和聲/回聲,選擇"VR模型",再從VR裏面找到"5_HP",右邊勾選僅保留人聲(Vocals Only)。

點擊下方的start,這樣就去除了和聲部分,這樣的話就變成了三個文件。

  • 同理,接下來進行:

  • 去除和聲的人聲→去除混響

    將剛纔新分離的文件同樣拖進第一行,然後還是用“VR模型”,但是這次選擇的“UVR-DeEcho-DeReverb”,然後右邊選擇不要混響(NO Reverb only)。

    點擊start,這樣就完成了最終的幹聲分離啦!這個就是我們待會要被替換的幹聲!

    • Tip:這裏可能有人會問

    沒有“5_HP”和“UVR-DeEcho-DeReverb”這2個模型怎麼辦?(如果有的話忽略下方的這步)

    點這裏Download下載,然後一定要選手動下載(Manual),自動的話可能非常慢!

    然後就是選擇對應的“5_HP”和“UVR-DeEcho-DeReverb”這2個模型

    2.換軟件,打開RVC

    將上面下好的RVC文件解壓之後,咱們雙擊這個go-web,等待一會兒會自動打開一個網頁

    變聲器的內容先不教,後面感興趣可以學,它既可以實時改變音質非常不錯變聲。

    等待十幾秒後,進入是這個樣子的:

    咱們只用到模型的這兩個功能“訓練”+“模型推理”。

    中間也有一個聲音分離,但是不太好用,沒有UVR5管用,會出現很多問題

    • 點擊“訓練”

    因爲是RVC模型,咱們需要至少10分鐘的烏魯魯幹聲素材,這個可以在網上找,一定不能有其它音出現。可以用URV5將幹聲提出來,根據前面的教學即可。但是一定要夠10分鐘的烏魯魯!

    將素材複製路徑時,記得將前後的引號去掉,然後點擊旁邊的處理數據。

    等待處理完後,按照我上圖的設置輪數,一般200輪就很清晰了,如果要求更高就選400輪。

    然後點下方的“訓練模型”即可,然後就是等待。

    訓練好後,會有一個wululu.pth模型,這個模型就可以用來一鍵替換了,後續就非常簡單了。

    • 嫌麻煩的同學我這裏有烏魯魯的模型分型給你們使用:

    通過網盤分享的文件:RVC烏魯魯模型(三角洲行動) 鏈接: https://pan.baidu.com/s/1XI0KdtwULdTS5XT-JC48dw 提取碼: xna9

    這裏面不僅有.pth文件,還有一個.index文件(變聲器用的)。只需要下載.pth就行了。

    下載好後放進這個路徑,不放進來的話,下一步模型推理就找不到這個wululu。

    RVC→assets→weights

    • 點擊“模型推理”

    選擇wululu這個模型,然後將之前的幹聲路徑放進來後就可以一鍵轉換了。

    轉換好後,就下載轉換好的幹音即可。

    有人問路徑複製方法:

    3.最後一步

    結合”轉換的幹聲+環境音“即可,很簡單。

    放進剪映,或者任何之類的軟件都可以,調整一下音量大小,然後點導出。

    導出的話,僅勾選音頻導出就可,將視頻導出去掉。

    這就完成啦!

    當然這只是最基礎的換音教學,只是方便大家使用這2個本地大模型。人聲沒有混響聽起來還是很奇怪的,而且也沒有改歌詞。

    下一篇進階篇,將會教會大家使用AI Midi,讓大家學會改詞翻唱,讓歌曲變得更具有魔性。

    由於有本篇的基礎,進階篇很快就能學會,敬請期待吧!

    如果喜歡的話,一定要給一君點個關注喔!

    更多遊戲資訊請關註:電玩幫遊戲資訊專區

    電玩幫圖文攻略 www.vgover.com