10分钟语音训练一个RVC变声音色:新手上手指南
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
素材只要10分钟,音色就能拿到手,这是RVC变声器最反直觉的地方。你不需要录音棚,也不需要一堆专业设备,一块普通N卡甚至CPU就能把训练跑完。它基于约50小时开源高质量数据集训练的底模,拿来即用,无版权顾虑。
它是什么,适合谁
RVC把「人声分离、训练、推理」装进同一个网页界面,三步能走完。对内容创作者、给游戏角色换声音的玩家、想做AI翻唱的新手都比较合适。能力要点有三条:
- 用10到50分钟人声素材训出音色模型,产出
.pth文件。 - 端到端约170毫秒的实时变声,换ASIO设备和驱动能压到90毫秒。
- 把两个音色模型按权重融合成一个新音色(ckpt-merge)。
先跑起来
环境要求三行说清:Python 3.8到3.10;一块N卡(没有也能用CPU,只是慢);装好FFmpeg。
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txtWindows用户双击go-web.bat启动,黑窗口不能关,关了网页就连不上。Linux/Mac用户执行python infer-web.py,浏览器会打开WebUI界面,默认端口7865。首次运行会提示下载assets下的预训练模型,下载完即可进入界面。
训练和推理各需要什么
整个流程只有两步:训练和推理。
- 训练:输入是10到50分钟人声素材加网页参数,产出是
weights下的.pth模型和logs下的.index索引。 - 推理:输入是任意一段源音频加转换参数,产出是换成目标音色的成品音频。
训练代码在 infer/modules/train/,推理代码在 infer/modules/vc/,出问题时对照目录就能明白卡在哪一步。
实战三步
第一步:准备素材
总时长10到50分钟,音质高、底噪低是底线。片段切成3到15秒的文件,太长容易出异常切片。素材带背景音乐的,先用界面里的人声伴奏分离选项卡分离出人声。混响重的房间音、离麦克风很远的收音,尽量别用。
过关标准:素材拷到纯英文、不含空格和括号的路径下,总时长不低于10分钟。
第二步:一键训练
进入训练选项卡,填完参数点「一键训练」,它会按顺序做四件事:提取音高、处理数据、训练模型、训练索引。新手全部保持默认,只改显存吃紧时的batch size。
| 参数 | 新手默认值 | 说明 |
|---|---|---|
| 采样率 | 48k | 效果最稳的一档 |
| 音高算法 | RMVPE | 精度最高,比crepe更省资源 |
| total_epoch | 100 | 底噪大的素材用20到30即可 |
| batch size | 看显存 | 不够就调小,调到1还报错只能换卡 |
| 索引参数 | 默认 | 建索引用,别动 |
过关标准:日志出现「Training is done」提示,且索引步骤产出added开头的.index文件。
第三步:推理试听
进入推理选项卡,先点「刷新音色列表」,选中刚训的.pth模型和对应的.index索引,上传源音频(人声或歌曲干声都行),点转换后下载试听。首次试听保持index rate为0.5、音高设为0。
过关标准:成品能听出目标音色的特征,且没有明显电音和破音。
踩坑与排查
显存不足:训练报 out of memory。原因是显存吃紧。解法是训练缩小batch size;推理调小 configs/config.py 结尾的x_pad、x_query。4G以下显存基本无解。
ffmpeg报错:素材路径含空格、括号或中文。原因是ffmpeg读路径异常。解法是把素材和工程都移到纯英文路径再跑。
训练完看不到音色:先点「刷新音色列表」;还没有就检查索引是否生成,必要时补点一次「训练索引」,再去logs目录查报错。
效果差:多为素材底噪大、时长不够。低质量素材把total_epoch压到20到30,轮数拉得再高也带不动;素材干净再往上加。
模型放错文件:能直接推理的是weights下60MB以上的.pth文件,logs下的几百MB检查点不能直接推理,需用ckpt处理选项卡提取小模型后再分享。
场景速览
游戏实时变声:端到端约170毫秒延迟,换ASIO设备能压到90毫秒,跑go-realtime-gui.bat即可。
AI歌手翻唱:上传一段翻唱干声,模型把音换成目标音色,输出可直接混进伴奏。
影视角色配音:同一段台词训一次,后续所有台词反复用,换配音成本接近于零。
音色融合:用ckpt-merge把两个.pth模型按权重合并,做出介于两者之间的新音色。
批量转换:推理选项卡支持批量处理,一次丢几十个文件,统一导出成品。
收尾
- 克隆仓库,装好依赖,把
go-web.bat跑通。 - 准备10分钟低底噪人声素材,放进纯英文路径。
- 用默认参数跑完一键训练,确认
.index文件已生成。 - 上传一段源音频做推理,先听效果,再调
index rate和音高。
第一次听到像的音色后,剩下的事就只剩换素材和反复微调参数了。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考