UVR 5.6人声分离完整指南:5步导出你的第一份人声与伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
做卡拉OK、采样翻唱、视频配乐时,常常需要把一首歌干净地拆成"人声"和"伴奏"两条轨道。Ultimate Vocal Remover GUI(下文简称 UVR)5.6 就是干这件事的:导入音频、选一个分离模型,它用深度学习网络把人声与伴奏分开,再导出成 WAV、FLAC 或 MP3。工具免费开源,覆盖 Windows、macOS、Linux 三大平台,面向没有算法背景的普通用户设计,跟着下面几步就能出结果。
环境准备:三种系统怎么装好 UVR
Windows:装到 C 盘就行
Windows 发布包已经内置 Python、PyTorch 等全部依赖,装完即用,无需额外准备:
- 建议 Windows 10 及以上系统;必须安装到 C 盘主目录,装到其他盘容易不稳定
- 使用 AMD Radeon 或 Intel Arc 显卡的用户,选 OpenCL 版本安装包
- 已装过旧版本的,直接覆盖安装更新补丁即可
macOS:按芯片选安装包,首次启动要耐心
macOS 版提供 arm64(M1 及以后)和 x86_64(Intel)两种安装包,要求 Big Sur 及以上。装好双击启动即可,M1 机型已支持 MPS(GPU)加速,可用于 Demucs v4 和全部 MDX-Net 模型。
两点提醒:首次启动可能需要 5-10 分钟完成初始化,属正常现象;如果系统安全机制拦截了应用,先执行下面两条命令再打开:
sudo spctl --master-disable sudo xattr -rd com.apple.quarantine /Applications/Ultimate\ Vocal\ Remover.appUVR 能正常打开后,建议把 spctl 重新启用回去。
Linux:Debian / Arch 系手动搭建
先获取仓库源码(Debian 与 Arch 系流程一致):
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremoverguiDebian 系(Ubuntu、Mint 等)依次执行:
sudo apt update && sudo apt upgrade sudo apt install ffmpeg python3-pip sudo apt-get -y install python3-tk pip3 install -r requirements.txt python3 UVR.pyArch 系则改用pacman -S安装python-pip、tk、ffmpeg,再执行同样的pip3 install -r requirements.txt。也可以直接运行项目自带的 install_packages.sh 脚本批量装 requirements.txt 里的依赖。注意:处理非 WAV 格式依赖 FFmpeg,变速与变调功能依赖 Rubber Band,缺了会报对应错误。
主流程实操:从导入歌曲到导出伴奏
以最常用的"去掉人声、保留伴奏"为例走一遍,整个过程不到一分钟就能启动处理:
- 选输入文件:点击 Select Input 选择要处理的音频,支持批量勾选多首歌。
- 设输出目录:用 Select Output 指定结果保存位置,避免找半天。
- 选分离方法:在 CHOOSE PROCESS METHOD 下拉框里选方法。音乐类音频推荐 MDX-Net 系列(内置模型列表里有 MDX23C-InstVoc HQ 等),伴奏干净度不错;想一次拆出人声、鼓、贝斯等多个成分,选 Demucs 的 4-stem 模型。
- 勾选要保存的轨:只留伴奏就勾选 secondary stem(伴奏轨)选项,避免把不需要的文件也写进硬盘。输出格式默认 WAV,也可按需在设置里改成 FLAC 或 MP3(最高 320k)。
- 开始处理:点击 Start Processing,等进度条走完。结果按文件名规则写入输出目录,打开试听即可。
同首歌换不同模型各跑一次、盲听对比,是选到合适模型最快的办法。
参数怎么调:3 个真正影响效果的旋钮
界面上选项不少,新手真正需要动的就下面这几个:
Segment Size(分段大小)——MDX-Net 默认 256,取值范围 32-4000。分段越大速度越快、内存占用越高,遇到内存报错就把它调小;编曲特别密的歌可试 128-192。
Overlap(重叠度)——决定相邻分段的重叠程度,MDX-Net 常用 0.25(默认)到 0.99,Demucs 则提供 0.25 / 0.50 / 0.75 / 0.99 几档。重叠越大,段与段之间的过渡越顺滑,但处理时间越长。MDX23C 模型的重叠参数是 2-50 的整数,别和 MDX-Net 的浮点值混用。
GPU Conversion——勾选后速度提升明显。NVIDIA 显卡至少 RTX 1060 6GB 才稳定,8GB 显存以上更从容;Mac M1 系列走 MPS 加速无需额外设置;纯 CPU 也能跑,只是慢。
一套调好的参数可以在 SELECT SAVED SETTINGS 里保存,下次直接调用;程序退出时也会自动记住当次设置。
避坑提示:这几个报错最常见
- 转换非 WAV 文件报错:几乎都是没装 FFmpeg。Windows/macOS 发布包已内置,Linux 按上一步装好即可。
- 处理中内存不足:调小 Segment Size 或 Window 大小,通常立刻解决。
- AMD 显卡想上 GPU 加速:CUDA 支持有限,Windows 下可试 OpenCL 版本,其他平台建议等官方实验分支。
- 要反馈问题:点 Start Processing 左侧的 Settings 按钮,打开 Error Log 导出日志再贴出来,比描述症状高效得多。
资源索引
- models/:内置模型文件目录,含 MDX-Net、Demucs、VR 三类模型数据
- lib_v5/vr_network/modelparams/:VR 架构各模型的 JSON 参数配置
- install_packages.sh:Linux 依赖一键安装脚本
- README.md:完整安装说明、GPU 要求与故障排查
第一份结果导出之后,剩下的功夫就一件事:拿同一首歌反复 A/B 对比不同模型,听起来更干净的那组参数,就是你的默认参数。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考