RVC语音克隆实战教程:10分钟干声,一次训练出专属AI歌手
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
一段10分钟的干声,跑完一次训练,就会变成一个能唱、能配音的新音色。这就是RVC(Retrieval-based-Voice-Conversion-WebUI)能给出的结果:一套在本地运行的语音克隆工具,打开Web界面点点鼠标,就能完成一次AI歌手制作。这篇RVC语音克隆教程带你从克隆仓库到出第一个音色,每一步都不跳过。
🎤 它能接住哪些场景
- AI歌手:把你的干声套进任意一首伴奏,"歌手"就成了你自己。
- 视频配音:把一段旁白的原始音色,批量换成指定声音。
- 直播或语音聊天:边说边转换,端到端延迟约170ms。
📦 环境安装:从克隆仓库到打开界面
先把代码拉到本机,需要Python 3.8及以上:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI克隆完成后,后面所有命令都在这个目录里执行。
接着装依赖,按你的显卡选对应那一行:
# N卡 pip install -r requirements.txt # A卡 / I卡(DirectML) pip install -r requirements-dml.txt # I卡 IPEX(Linux) pip install -r requirements-ipex.txtLinux上的AMD显卡用户,改执行pip install -r requirements-amd.txt即可。
然后用仓库自带的脚本,下载训练和推理都要用的预训练模型文件:
python tools/download_models.py看到 assets/hubert、assets/pretrained 等目录里出现新的 .pt 文件,说明下好了。
最后启动Web界面:
python infer-web.py浏览器打开终端里打印的地址,训练和推理的界面就出来了。
🎛️ 训练实操:数据、参数与验证
数据要求很简单:
- 干声10分钟起步,底噪越小越好。
- WAV格式,采样率建议44100Hz。
- 避开长时间静音和重混响片段。
- 素材带伴奏的,先用界面里的UVR5页签分离出人声。
真正影响效果的参数只有四个:
- total_epoch 总训练轮数:建议20–30轮,更多不一定更好。
- batch_size:界面会按显存给出建议值,报显存错误就改到1。
- index_rate:决定结果向目标音色靠多近,先保持默认。
- pitch:男转女一般+12,女转男一般-12。 其余参数保持默认即可,直接点开始训练,等它跑完。
训练结束后,用耳朵做三件事自检:
- 听有没有"电音感",有就说明音高提取或偏移有问题。
- 听音色"像不像"训练集,越像说明数据越干净。
- 听是否发闷、发飘,是的话后面要调高 index_rate。
🔊 效果调优:从"能跑"到"好听"
| 旋钮 | 怎么调 | 对应什么问题 |
|---|---|---|
| pitch | 男转女+12到+15,女转男-12到-15 | 整体音高比原声高一截或低一截 |
| index_rate | 训练集一般取0.3–0.7,训练集好就调高 | 音色串了原声,或相似度不够 |
| 音高提取算法 | 默认RMVPE;crepe最准但最慢;harvest适合高质量录音 | 跑调、哑音、破音明显 |
RMVPE 是从人声里提取"基频"的音高提取算法,多数素材选它就够。只有精度明显不够时,才换crepe试试。
🚀 进阶玩法
- 实时变声:运行
tools/rvc_for_realtime.py,端到端延迟约170ms;用ASIO音频设备可降到约90ms。 - 模型融合:把两个训练好的模型按权重混合,得到一个新音色,用WebUI的ckpt-merge页签或
tools/infer/trans_weights.py脚本都能做。 - 人声伴奏分离:UVR5页签可以从歌曲里抽人声、或只留伴奏,给训练数据做准备很方便。
🩺 排错清单:看到什么,就查什么
- 训练报显存不足→ 多半是 batch_size 太大 → 改到1,切32000Hz采样率模式,重新训练。
- 训练完了,推理时选不到索引→ 索引训练没跑完或被打断 → 手动点"训练索引"按钮重新生成;训练集文件太多就先减少数量。
- 实时变声明显"跟不上"→ 后台程序占资源或缓冲区过大 → 关掉后台程序,调低采样率,换ASIO兼容声卡。
- 转换后声音像"电音"→ 音高提取错了或没校正 → 算法切到RMVPE,再把pitch按±12逐格调到与原声同调。
- 结果噪声明显、音色不像→ 训练数据底噪大或时长不够 → 先用UVR5去噪,素材扩到10分钟以上,重新训练。
📚 资源入口
- 中文文档:docs/cn/,含常见问题和更新日志。
- 多语言界面文件:i18n/locale/,共13种语言。
- 推理主配置:configs/config.json,推理参数都在这。
- 英文训练建议:docs/en/training_tips_en.md。
顺带提醒一句:音色模型请只用于个人创作,别拿去模仿特定真实人物的声音。
回到开头:10分钟干声,足够做出一个能用的新音色。先拿自己的声音训练一个,再凭耳朵把 pitch 和 index_rate 调到位,这就是上手RVC最快的路径。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考