RVC语音克隆实战教程:10分钟干声,一次训练出专属AI歌手
2026/9/20 0:08:33 网站建设 项目流程

RVC语音克隆实战教程:10分钟干声,一次训练出专属AI歌手

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

一段10分钟的干声,跑完一次训练,就会变成一个能唱、能配音的新音色。这就是RVC(Retrieval-based-Voice-Conversion-WebUI)能给出的结果:一套在本地运行的语音克隆工具,打开Web界面点点鼠标,就能完成一次AI歌手制作。这篇RVC语音克隆教程带你从克隆仓库到出第一个音色,每一步都不跳过。

🎤 它能接住哪些场景

  • AI歌手:把你的干声套进任意一首伴奏,"歌手"就成了你自己。
  • 视频配音:把一段旁白的原始音色,批量换成指定声音。
  • 直播或语音聊天:边说边转换,端到端延迟约170ms。

📦 环境安装:从克隆仓库到打开界面

先把代码拉到本机,需要Python 3.8及以上:

git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

克隆完成后,后面所有命令都在这个目录里执行。

接着装依赖,按你的显卡选对应那一行:

# N卡 pip install -r requirements.txt # A卡 / I卡(DirectML) pip install -r requirements-dml.txt # I卡 IPEX(Linux) pip install -r requirements-ipex.txt

Linux上的AMD显卡用户,改执行pip install -r requirements-amd.txt即可。

然后用仓库自带的脚本,下载训练和推理都要用的预训练模型文件:

python tools/download_models.py

看到 assets/hubert、assets/pretrained 等目录里出现新的 .pt 文件,说明下好了。

最后启动Web界面:

python infer-web.py

浏览器打开终端里打印的地址,训练和推理的界面就出来了。

🎛️ 训练实操:数据、参数与验证

数据要求很简单:

  • 干声10分钟起步,底噪越小越好。
  • WAV格式,采样率建议44100Hz。
  • 避开长时间静音和重混响片段。
  • 素材带伴奏的,先用界面里的UVR5页签分离出人声。

真正影响效果的参数只有四个:

  • total_epoch 总训练轮数:建议20–30轮,更多不一定更好。
  • batch_size:界面会按显存给出建议值,报显存错误就改到1。
  • index_rate:决定结果向目标音色靠多近,先保持默认。
  • pitch:男转女一般+12,女转男一般-12。 其余参数保持默认即可,直接点开始训练,等它跑完。

训练结束后,用耳朵做三件事自检:

  • 听有没有"电音感",有就说明音高提取或偏移有问题。
  • 听音色"像不像"训练集,越像说明数据越干净。
  • 听是否发闷、发飘,是的话后面要调高 index_rate。

🔊 效果调优:从"能跑"到"好听"

旋钮怎么调对应什么问题
pitch男转女+12到+15,女转男-12到-15整体音高比原声高一截或低一截
index_rate训练集一般取0.3–0.7,训练集好就调高音色串了原声,或相似度不够
音高提取算法默认RMVPE;crepe最准但最慢;harvest适合高质量录音跑调、哑音、破音明显

RMVPE 是从人声里提取"基频"的音高提取算法,多数素材选它就够。只有精度明显不够时,才换crepe试试。

🚀 进阶玩法

  • 实时变声:运行tools/rvc_for_realtime.py,端到端延迟约170ms;用ASIO音频设备可降到约90ms。
  • 模型融合:把两个训练好的模型按权重混合,得到一个新音色,用WebUI的ckpt-merge页签或tools/infer/trans_weights.py脚本都能做。
  • 人声伴奏分离:UVR5页签可以从歌曲里抽人声、或只留伴奏,给训练数据做准备很方便。

🩺 排错清单:看到什么,就查什么

  1. 训练报显存不足→ 多半是 batch_size 太大 → 改到1,切32000Hz采样率模式,重新训练。
  2. 训练完了,推理时选不到索引→ 索引训练没跑完或被打断 → 手动点"训练索引"按钮重新生成;训练集文件太多就先减少数量。
  3. 实时变声明显"跟不上"→ 后台程序占资源或缓冲区过大 → 关掉后台程序,调低采样率,换ASIO兼容声卡。
  4. 转换后声音像"电音"→ 音高提取错了或没校正 → 算法切到RMVPE,再把pitch按±12逐格调到与原声同调。
  5. 结果噪声明显、音色不像→ 训练数据底噪大或时长不够 → 先用UVR5去噪,素材扩到10分钟以上,重新训练。

📚 资源入口

  • 中文文档:docs/cn/,含常见问题和更新日志。
  • 多语言界面文件:i18n/locale/,共13种语言。
  • 推理主配置:configs/config.json,推理参数都在这。
  • 英文训练建议:docs/en/training_tips_en.md。

顺带提醒一句:音色模型请只用于个人创作,别拿去模仿特定真实人物的声音。

回到开头:10分钟干声,足够做出一个能用的新音色。先拿自己的声音训练一个,再凭耳朵把 pitch 和 index_rate 调到位,这就是上手RVC最快的路径。

【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询