RVC 声音转换完整部署指南:10 分钟素材练出专属变声模型
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
RVC(Retrieval-based Voice Conversion WebUI)是一个基于 VITS 的开源变声框架:喂给它 10 分钟以内的干净录音,就能训出一个把你的声音换成别人音色的模型,N 卡、A 卡、I 卡甚至纯 CPU 都能跑。本文带你从硬件自检到第一次转换成功,全程不到一上午。
为什么值得试
素材门槛极低。传统语音合成动辄要几小时语料,RVC 靠 top1 检索把输入源特征替换成训练集特征,10 分钟低底噪语音就能练出清晰度和相似度都在线的模型。
显卡不限阵营。Nvidia 走 CUDA,AMD 走 ROCm/DirectML,Intel 核显可用 DirectML 和 IPEX 加速,纯 CPU 也能用,只是训练会变慢。
两个界面各管一件事。WebUI 负责训练和批量转换,实时 GUI 负责低延迟变声,官方实测常规配置端到端延迟 170ms,配 ASIO 声卡能压到 90ms。
扩展能力不少。自带 UVR5 人声伴奏分离、ckpt 模型融合、ONNX 模型导出,还有 api_240604.py 这类现成接口方便二次开发。
部署前自检
跑之前先对照这份清单,差哪样补哪样:
- 显卡:Nvidia 需支持 CUDA Compute Capability 3.5+(GTX 1050Ti 起步);AMD 需 ROCm 4.0+(RX 5700 起步);Intel 需支持 DirectML(UHD 630 起步);没有独立显卡就退回 CPU 模式
- 内存:最低 8GB,16GB 更稳
- 磁盘:预留约 10GB 给程序本体和模型文件
- 系统:Windows 10/11 64 位、Ubuntu 20.04+ / Debian 11+、macOS 12+
- 网络:首次运行要联网拉取约 20 个模型文件,建议网络稳定
💡 查显卡型号:Windows 看"设备管理器 → 显示适配器";Linux 执行lspci | grep -i vga;macOS 看"系统报告 → 图形/显示"。
⚠️ 32 位系统直接放弃,依赖装不上;内存低于 4GB 的机器跑不动 WebUI。
在你的机器上跑起来
零基础上手(快速体验)
- 从官方渠道下载整合包并解压
- 双击根目录的
go-web.bat
一条命令起 WebUI,适合只想先听效果的 Windows 用户,代价是只有基础转换功能。
完整安装(训练与开发)
- 装好 Python 3.8–3.10(推荐 3.9),
python --version确认版本 - 克隆仓库:
git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI把项目代码拉到本地 - 装 PyTorch,按显卡选源:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117给 Nvidia 装 CUDA 版;A/I 卡换 rocm 或 cpu 源 - 装项目依赖,按显卡选文件:
pip install -r requirements.txtN 卡装这个,A/I 卡改成requirements-dml.txt - Linux 建议先
python3 -m venv venv && source venv/bin/activate隔离环境;macOS 可以直接sh ./run.sh,脚本自动建虚拟环境、装依赖、下模型。
模型与资源准备
三步串成一条流水线走完:
- 下载模型。在项目根目录执行
python tools/download_models.py,脚本会自动把hubert_base.pt、rmvpe.pt、v1/v2 两套assets/pretrained权重、UVR5 降噪权重全部放进 assets/ 对应子目录,不用手动建文件夹 - 装 ffmpeg。所有音频切割、格式转换都靠它:Windows 把
ffmpeg.exe、ffprobe.exe丢到项目根目录,Linuxsudo apt install ffmpeg,macOSbrew install ffmpeg - 抽查完整性。挑大文件算个哈希,
sha256sum assets/hubert/hubert_base.pt(Windows 用certutil -hashfile),和发布源对不上就重新下载,缺文件会直接导致启动报错
第一次完整跑通
启动界面。python infer-web.py,浏览器自动打开,默认监听 7865 端口(可用--port改)。看到训练、转换各选项卡就说明环境通了。
准备数据。收 10–30 分钟无背景噪音的录音,WAV 格式。先在"切分音频"页上传,让切片器把长音频切成短句;底噪大就先跑一遍 UVR5 降噪。
开训。模型版本选 v1 或 v2,采样率按需求定 32k/40k/48k——48k 音质最好但最吃资源;轮数默认 100 起,批大小看显存在 4–16 之间挑。点开始后盯损失曲线稳步下降。训练产物落在logs目录,G_*.pth是你后续的推理模型。
完成转换。在转换选项卡加载刚训的G_*.pth,上传一段待转换音频,调三个参数:音高偏移(-12~+12 半音)、相似度阈值(0.3~0.9,越高越像目标音色)、降噪强度(0~0.5)。点转换,处理完直接试听下载。
让它更快
| 硬件档位 | 推荐参数 | 预期效果 |
|---|---|---|
| 4 核 8 线程 + 8GB 内存(纯 CPU) | batch=2,采样率 32k | 约 0.5 倍实时速度 |
| 6 核 12 线程 + 16GB 内存 | batch=4,采样率 32k | 约 1 倍实时速度 |
| GTX 1050Ti / 4GB 显存 | batch=4 | 数倍实时速度 |
| RTX 3060 / 12GB 显存 | batch=8 | 约 10 倍实时速度 |
| RTX 4090 / 24GB 显存 | batch=16 | 30 倍实时以上 |
推理时的x_pad、x_query、x_center、x_max四个值不用手改:configs/config.py 会按显存自动套用 5G/6G 档位的组合,显存 ≤4GB 时还会降一档。想手动收紧就在configs/下对应采样率的 json 里改训练参数;采样率从 48k 降到 32k 是对 CPU 最立竿见影的加速。
出问题时的排查速查
- 启动报
FileNotFoundError: xxx.pt→ 模型文件缺失或没下完 → 重跑python tools/download_models.py CUDA out of memory→ 显存不够 → 训练调小 batch;推理收紧 x_pad 等参数;老卡(GTX 1060–1080)程序已自动切 fp32,别强行开半精度- 转换后杂音、破音、卡顿→ 源音频底噪大或参数偏了 → 先降噪再切分;相似度阈值调低;换 F0 预测器试试(RMVPE/crepe/dio 等)
- pip 全程红字装不上→ Python 版本不在 3.8–3.10 区间 → 先
python -m pip install --upgrade pip,再换对的 Python 重来;Windows 用户可直接改用整合包 - 实时模式延迟忽高忽低→ 音频设备链路太慢 → 换 ASIO 设备,输入输出走同一驱动
还能用在哪些场景
内容创作(配音/有声书/游戏语音)。收 10–15 分钟目标角色参考音频 → 按 48k 采样率、150 轮以上训练 → 用 TTS 生成底稿 → RVC 转换 → 后期修语速和停顿。坑:相似度阈值拉满会牺牲自然度,像和稳之间留点余地。
实时通讯变声(游戏/直播/会议)。选 32k 轻量模型 → 启动实时 GUI(Windows 双击go-realtime-gui.bat,其他平台python gui_v1.py)→ 配 ASIO 设备把端到端延迟压进 150ms → 用虚拟音频电缆把变声输出路由给通讯软件。坑:扬声器外放 + 麦克风收音会形成反馈,务必戴耳机。
语音助手定制(智能音箱/客服机器人)。收 30 分钟以上清晰目标语音 → 48k 高采样率训练 → 用 tools/export_onnx.py 导出 ONNX 模型 → 接入合成链路。坑:导出脚本里的模型路径要手动改成你自己的.pth。
到这里,从自检、部署到第一次转换的整条链路就通了。想继续深挖训练技巧和多语言文档,项目里都备好了:官方中文文档(含 更新日志)、训练技巧、常见问题,训练源码在 infer/modules/train/,推理管线在 infer/modules/vc/。
【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data <= 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考