如何用AI翻唱自己喜欢的歌曲?(基础篇)【0成本】

上一期的AI经历引发了很多人的关注和点赞,很多盒友也展现了很浓的兴趣。

https://api.xiaoheihe.cn/v3/bbs/app/api/web/share?h_camp=link&h_src=YXBwX3NoYXJl&link_id=77657206a38b

看到了很多同龄人的经历,为了帮助大家很容易上手学习AI,我开始决定无偿帮助大家,从0开始学习不同AI工具和知识,并且相互结合。

为了不让教学过程很干燥,我决定用比较有趣内容进行教学。

注意:本人不卖课!不推软件会员!

如果是为了赚盒友的钱,天打雷劈

在给大家教学的过程中也在鞭策自己学更多的AI知识,这样才能继续给大家当老师了,哈哈。

废话不多说了,咱们直接听成片曲:

  • 今天要学的是,“0成本”如何用AI翻唱自己喜欢的歌曲?(基础篇)

教学目录

一、下载歌曲

二、翻唱原理

三、需要部署的模型

四、完整步骤

一、下载歌曲

首先,先要挑好咱们自己想要更改的歌曲,可以去网上下载,也可以在客户端下载(QQ音乐、网易云)。

但是某些下载后的歌曲可能并不是MP3等格式,无法正常打开,只能通过原客户端打开。

这里可以使用开源的网站,将网易云下载的特殊格式的音乐变成正常格式:

https://convert.freelrc.com/NCM-to-MP3

免费无需登录

二、翻唱原理

原理很简单:

  • 下载好的歌曲→人声+背景音

然后通过训练好的音域模型,一键替换人声即可,再把背景音拿回来组合一下就行。

比如:主唱的歌词部分为人声,而弹奏的吉他、贝斯、钢琴等乐器、伴奏都属于背景音。

要注意的是下面的步骤:

  • 人声→“干声”+和声+混响

但是,咱们要替换的只是人声的干声部分,还要剔除掉“和声”和“混响”

什么是和声?就是不同的音同时发声,得去除掉!

如果不去除和声和混响,就会导致替换后的干音出现哑音多,或者不准确的问题。

三、需要部署的模型

我的教程中会需要下载两个本地开源模型,两个加起来大概20G左右,都是无需登录无需使用会员的开源大模型(均在Github上能下载到)

1.UVR5

UVR5的本地部署,是为了让我们分离下载歌曲的“人声+背景声”,这一步是非常关键的。

虽然很多软件也能分离人声和背景音,但是我们还需要进行消除“和声和混响”,这个软件是全球最强的分离模型,毋庸置疑。

Github下载UVR5地址(最好用谷歌浏览器,原本浏览器会卡进度):

https://github.com/Anjok07/ultimatevocalremovergui/releases/tag/v5.6

2.RVC(至少8G显存)

这个音域大模型首先帮助我们训练想要的声音,比如开头的乌鲁鲁,通过多轮学习之后就可以用来改任何一切的歌曲。(显卡算力越强越快)

其次,用训练好的乌鲁鲁模型一键替换人声,就可以使其达到翻唱的效果!

这里是下载链接[根据自己的显卡去下载](最好用谷歌浏览器,原本浏览器会卡进度)

www.yuque.com/flowercry/hxf0ds

两个都在本地下载好部署之后,就开始咱们今天的教学了。

四、完整步骤

1.分离人声+背景音→分离干声

打开UVR5,咱们开始分离下载好的歌曲,将歌曲分成“人声+背景音”。

将歌曲拖进第一行,然后,第二行选择一个保存的路径即可。

然后使用MDX-Net,根据我的设置即可,输出的音频WAV最清晰,然后有显卡的话就勾选GPU这个选项工作,没有就不勾选。

  • 点击下方的start

等待UVR5这个模型处理完之后,在保存的路径上就有两个文件,“1个人声+1个背景音”。

  • 接下来进行:

人声→去除和声/回声

将人声拖进去,咱们开始去除和声/回声,选择"VR模型",再从VR里面找到"5_HP",右边勾选仅保留人声(Vocals Only)。

点击下方的start,这样就去除了和声部分,这样的话就变成了三个文件。

  • 同理,接下来进行:

  • 去除和声的人声→去除混响

    将刚才新分离的文件同样拖进第一行,然后还是用“VR模型”,但是这次选择的“UVR-DeEcho-DeReverb”,然后右边选择不要混响(NO Reverb only)。

    点击start,这样就完成了最终的干声分离啦!这个就是我们待会要被替换的干声!

    • Tip:这里可能有人会问

    没有“5_HP”和“UVR-DeEcho-DeReverb”这2个模型怎么办?(如果有的话忽略下方的这步)

    点这里Download下载,然后一定要选手动下载(Manual),自动的话可能非常慢!

    然后就是选择对应的“5_HP”和“UVR-DeEcho-DeReverb”这2个模型

    2.换软件,打开RVC

    将上面下好的RVC文件解压之后,咱们双击这个go-web,等待一会儿会自动打开一个网页

    变声器的内容先不教,后面感兴趣可以学,它既可以实时改变音质非常不错变声。

    等待十几秒后,进入是这个样子的:

    咱们只用到模型的这两个功能“训练”+“模型推理”。

    中间也有一个声音分离,但是不太好用,没有UVR5管用,会出现很多问题

    • 点击“训练”

    因为是RVC模型,咱们需要至少10分钟的乌鲁鲁干声素材,这个可以在网上找,一定不能有其它音出现。可以用URV5将干声提出来,根据前面的教学即可。但是一定要够10分钟的乌鲁鲁!

    将素材复制路径时,记得将前后的引号去掉,然后点击旁边的处理数据。

    等待处理完后,按照我上图的设置轮数,一般200轮就很清晰了,如果要求更高就选400轮。

    然后点下方的“训练模型”即可,然后就是等待。

    训练好后,会有一个wululu.pth模型,这个模型就可以用来一键替换了,后续就非常简单了。

    • 嫌麻烦的同学我这里有乌鲁鲁的模型分型给你们使用:

    通过网盘分享的文件:RVC乌鲁鲁模型(三角洲行动) 链接: https://pan.baidu.com/s/1XI0KdtwULdTS5XT-JC48dw 提取码: xna9

    这里面不仅有.pth文件,还有一个.index文件(变声器用的)。只需要下载.pth就行了。

    下载好后放进这个路径,不放进来的话,下一步模型推理就找不到这个wululu。

    RVC→assets→weights

    • 点击“模型推理”

    选择wululu这个模型,然后将之前的干声路径放进来后就可以一键转换了。

    转换好后,就下载转换好的干音即可。

    有人问路径复制方法:

    3.最后一步

    结合”转换的干声+环境音“即可,很简单。

    放进剪映,或者任何之类的软件都可以,调整一下音量大小,然后点导出。

    导出的话,仅勾选音频导出就可,将视频导出去掉。

    这就完成啦!

    当然这只是最基础的换音教学,只是方便大家使用这2个本地大模型。人声没有混响听起来还是很奇怪的,而且也没有改歌词。

    下一篇进阶篇,将会教会大家使用AI Midi,让大家学会改词翻唱,让歌曲变得更具有魔性。

    由于有本篇的基础,进阶篇很快就能学会,敬请期待吧!

    如果喜欢的话,一定要给一君点个关注喔!

    更多游戏资讯请关注:电玩帮游戏资讯专区

    电玩帮图文攻略 www.vgover.com