UVR 人声伴奏分离完整指南:从去人声伴奏到多轨分离的落地手册
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
做翻唱时你多半遇到过这个死结:手里只有一版混好的成品,想要一段干净的伴奏来跟唱,或者想把某段人声单独抠出来做采样,但素材里没有分轨。手动用 EQ 或降噪去人声,结果要么把乐器一起削掉,要么留下明显的相位残留。UVR(Ultimate Vocal Remover)走的是另一条路——它用深度学习做AI 音频分离,把一首混音直接拆成人声与伴奏两轨,甚至按乐器拆成四轨。对只想"拿个能用的伴奏"的人,这套工具的价值在于:你不需要懂音频算法,选对模型、点一次 Start Processing 就能拿到结果。
工具定位:一句话讲清它是什么
UVR 是一个开源(MIT 协议)的图形界面程序,核心工作是人声伴奏分离:输入一个音频文件,输出*_Vocals.wav(人声)与*_Instrumental.wav(伴奏)。它面向三类人——做翻唱/卡拉OK 的、做混音和采样的、以及需要把录音里人声单独提出来做后期(降噪、修音)的。它同时支持 Windows、macOS、Linux,并且针对苹果 M1/M2 芯片做了 GPU 加速优化。当前版本为v5.6.0,核心分离逻辑集中在 separate.py,界面入口是 UVR.py。
一个容易误解的点:UVR 不是"降噪器",而是"分离器"。它假设你有一首已经混好的歌,目标是把它拆开;如果你要的是压掉底噪,那是分离之后、或配合其他工具做的事。
极速上手:一条最短跑通路径
把"装"和"第一次跑"压到最少步骤。Windows 与 macOS 用户直接下载官方安装包即可,依赖已内置;下面以 Linux 手动安装为例,这是最能看清依赖关系的路径。
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui ./install_packages.sh python3 UVR.pyinstall_packages.sh做的事很直接:逐行读取 requirements.txt 里的依赖并pip install,所以它等价于"按清单装 PyTorch、librosa、soundfile 等"。装完python3 UVR.py启动界面。
第一次运行只有两件事必须做对:
- 非 WAV 文件依赖 FFmpeg。你喂 MP3/FLAC 时,UVR 靠系统里的 FFmpeg 转码;缺了它,程序会在处理非 WAV 文件时报错。Linux 下
sudo apt install ffmpeg即可解决。 - 选对输入/输出。界面顶部
Select Input选文件(或文件夹),Select Output指定导出目录,输出格式在 WAV / FLAC / MP3 里选一个。
模型权重放在models/下,程序自动加载,你不需要手动下载——具体有哪几个,下一节讲。
分离引擎与模型矩阵:先选架构,再挑模型
UVR 内置三套分离架构,区别不在"谁更好",而在"谁更适合你这首素材"。选型顺序建议是:先定架构 → 再在该架构下挑模型 → 最后调参数。
| 架构 | 擅长的事 | 典型输出轨 | 什么时候选它 |
|---|---|---|---|
| MDX-Net | 人声/伴奏二分离,成品度高 | Vocals、Instrumental,另有 Bass、Drums、Other、Reverb 等专项 | 要一段干净的翻唱伴奏,或单独提人声 |
| VR Architecture | 定制化的"去掉某一类元素" | Instrumental、Vocals,以及 No Piano、No Reverb、Echo、Noise 等 | 现场录音、只想去掉钢琴/混响/噪音这类专项任务 |
| Demucs | 多轨拆分,一次出四轨 | vocals、drums、bass、other | 编曲复杂、想把乐器也拆开做教学/采样 |
模型文件按架构分目录存放,这是你判断"到底有哪些可选"的可靠来源:
- models/MDX_Net_Models/:人声与伴奏类模型最多,含
is_karaoke标记的卡拉OK向模型。 - models/VR_Models/:以
model_data.json里的primary_stem描述每个模型去的是什么轨,能看到 No Woodwinds、No Reverb、Noise 等专项。 - models/Demucs_Models/:v3/v4 的多轨模型。
一个实用判断法:你要的是一句"人声 vs 伴奏",就从MDX-Net里挑成品最高的那个(界面默认项MDX23C-InstVoc HQ即属此类);你要的是"把鼓和贝斯也拆出来",直接上Demucs四轨;你要的是"只把钢琴去掉、人声保留"这类很具体的诉求,去VR里找对应primary_stem的模型。
实战案例拆解:三个可复现的小任务
下面三个案例都给出"输入 → 操作 → 产出",你可以照着做一遍验证。
案例一:翻唱去人声,拿一段伴奏
- 输入:一首翻唱的 MP3。
- 操作:
Choose Process Method选MDX-Net,模型选成品高的 Vocals/Instrumental 二分离模型;勾选Instrumental Only(只出伴奏,省一半时间);Segment Size保持 256,Overlap设为 8;有 N 卡就勾上GPU Conversion。 - 产出:输出目录里得到
xxx_(Instrumental).wav,可直接进 DAW 当跟唱伴奏。
案例二:访谈/播客提人声
- 输入:一段带环境噪音的访谈录音(WAV 最佳)。
- 操作:架构选VR Architecture,挑
primary_stem为 Vocals 或 Noise 方向的模型;勾选Vocals Only;参数沿用 256 / 8。 - 产出:
xxx_(Vocals).wav,人声被单独提出,方便后续接降噪或修音工具处理。
案例三:把一首歌拆成四轨做素材
- 输入:编曲较全的成品曲。
- 操作:架构选Demucs,选 v3/v4 四轨模型;不勾"Only",让四轨都导出。
- 产出:
vocals / drums / bass / other四个.wav,可直接拿鼓轨和贝斯轨做 remix 或教学演示。
性能与调优:让分离更快、更稳
这一节的目标只有一个:同样一首歌,处理得更快、内存更稳、接缝更少。
硬件基线(官方标注)
- GPU 加速的最低门槛是 NVIDIA RTX 1060 6GB,推荐 8GB 以上显存;M1/M2 走 MPS,Demucs v4 与全部 MDX-Net 模型都支持。
- 没有独显也能跑,自动落到CPU,只是慢一些。AMD Radeon / Intel Arc 有单独的 OpenCL 版本可试。
三个关键参数
- Segment Size(分段大小):把音频切成多长的片段喂给模型。数值越小越省内存、但可能牺牲一点衔接质量;越大越快、但越吃显存。吃紧时从 1024 往 512、256 降,基本不牺牲成品度还能避开内存分配报错。
- Overlap(重叠度):相邻预测窗口的重叠程度,用来抹掉分段带来的接缝。MDX-Net 系列默认推荐8;Demucs 用的是 0.25–0.99 的比例刻度。调高更平滑但更耗时,调低更快但可能出现拼接痕迹。
- GPU Conversion(GPU 加速):把模型搬到 GPU 上推理,N 卡下能带来数倍提速,长音频收益最明显。没有可用 GPU 时不要勾,程序会自动退回 CPU。
周边建议
- 输入/输出目录放 SSD,减少大文件读写的等待。
- 报"内存分配错误"时,第一反应是把 Segment Size 调小,而不是加机器。
- 处理长文件时关掉吃内存的后台程序,给推理留出空间。
工程化与自动化:从单文件到批处理
UVR 的主界面是图形界面,但它的工程化能力不止于点按钮。
- 批量处理走"选文件夹":
Select Input可以直接选一个目录,程序会遍历处理其中的音频文件,省去逐个拖入。做一批翻唱伴奏时这是最高效的路径。 - 固化参数用 Saved Settings:把一套调好的架构+模型+参数存成配置,下次直接加载,避免每首重调。
gui_data/saved_settings/下就是你保存的预设。 - 引擎可复用:separate.py 里按架构拆成了独立类,如
SeperateMDX、SeperateDemucs、SeperateVR,输入音频路径、输出目录、模型与参数后调用对应seperate()即可产出。如果你要把分离嵌进自己的流水线,可以从这里 import 复用,而不是依赖界面。示意:
from separate import SeperateMDX # 另有 SeperateDemucs / SeperateVR # 组装好 model_data 与 process_data 后: # engine = SeperateMDX(model_data, process_data); engine.seperate()说明:
demucs/子目录里的__main__.py是模型训练/评测入口(需要 MusDB 数据集),不是面向普通用户的推理命令行,批量分离仍建议走界面选文件夹或复用separate.py。
生态与社区
- 许可证:代码遵循MIT,可免费使用、修改、分发;使用其中的模型时建议保留对 UVR 及其开发者的署名。
- 版本节奏:当前为v5.6.0,跨平台安装包持续更新,历史变更可查 gui_data/change_log.txt。
- 社区入口:问题反馈、功能建议与贡献都通过项目的 issue 与 pull request 进行;维护者只对本项目及随附模型负责,第三方衍生模型的质量需自行判断。
行动清单:按这个顺序走一遍
- 确认系统装了FFmpeg(Linux:
sudo apt install ffmpeg),否则非 WAV 文件会报错。 Select Input选文件或文件夹,Select Output指定导出目录,输出格式选 WAV。- 按素材选架构:要伴奏/提人声 → MDX-Net;要拆多轨 → Demucs;专项去某元素 → VR。
- 设Segment Size = 256、Overlap = 8;有 N 卡勾GPU Conversion,内存吃紧就调小分段。
- 点Start Processing,到输出目录核对
_(Vocals)与_(Instrumental)两个文件是否齐全。
做完这五步,你就把 UVR 从"装上了"推进到"稳定出活"了。之后要提效,重点只有两个方向:用 Saved Settings 固化参数、用文件夹批量替代单文件。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考