Ultimate Vocal Remover(UVR)5.6 人声分离完整指南:从安装到第一次伴奏提取的简单流程
2026/9/5 18:38:13 网站建设 项目流程

Ultimate Vocal Remover(UVR)5.6 人声分离完整指南:从安装到第一次伴奏提取的简单流程

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

手里有一首完整录制的歌曲,你想把它拆成两半:一段干净的人声,一段去掉人声的伴奏。这正是 Ultimate Vocal Remover(UVR)做的事情——一款基于深度神经网络的 AI 人声分离桌面工具,它能把混合音频里的人声、伴奏、低音、鼓点分别提取出来,供你伴奏提取、翻唱伴奏制作或素材整理。UVR 5.6 内置 Demucs、MDX-Net、VR Architecture 三套核心分离引擎,覆盖从整曲多轨分离到单人声精提的常见需求。

📦 UVR 安装与启动:Windows 和 Linux 两条路线

Windows:装好的安装包或源码构建

Windows 上有两种安装方式。最省事的是直接下载官方预编译安装包(v5.6 对应 UVR_v5.6.0_setup.exe,安装到 C 盘可避免不稳定问题),里面已包含 Python、PyTorch 等全部依赖;使用 AMD Radeon 或 Intel Arc 显卡的用户可以选用 OpenCL 版本。

如果你倾向于自己从源码安装,克隆仓库后安装依赖即可:

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremovergui pip install -r requirements.txt

如果机器上有兼容的 NVIDIA 显卡,再补装 CUDA 版本的 PyTorch(cu117 索引)可以明显加快处理速度。另外记住两点:处理 MP3、FLAC 等非 WAV 文件需要系统里装好 FFmpeg;使用变速变调(Time Stretch / Change Pitch)功能则依赖 Rubber Band 库,把对应可执行文件放到 UVR 目录即可。

Linux:用内置脚本一键装依赖

Debian/Ubuntu 系系统先用包管理器装好基础组件(ffmpeg、python3-pip、python3-tk),然后用仓库自带的 install_packages.sh 脚本按 requirements.txt 逐个安装 Python 依赖,最后启动主程序 UVR.py:

sudo apt install ffmpeg python3-pip python3-tk chmod +x install_packages.sh ./install_packages.sh python3 UVR.py

Arch 系(EndeavourOS 等)流程相同,只是把apt换成pacman安装ffmpegpython-piptk三个包。首次启动会加载模型列表,稍等片刻即可进入主界面。

硬件方面,官方给出的参考线是:使用 GPU 加速至少需要 RTX 1060 6GB 级别的显卡,8GB 及以上显存的 NVIDIA 显卡体验更从容;没有独立显卡时程序会自动退回 CPU 模式,能跑通但速度会慢不少。

🎛 三类引擎怎么选:Demucs、MDX-Net 与 VR Architecture

UVR 的主界面用选项卡区分引擎,选错引擎往往比参数没调好更影响结果。先按你要的"产出"来定方向:

Demucs 模型:一次拆出四轨整曲

Demucs 是 Facebook 开源的多轨音源分离算法,UVR 中的 demucs/ 目录即其核心实现,模型文件存放于 models/Demucs_Models/(含 v3 与 v4 两代)。它的特点是把一首歌拆成人声、伴奏、低音、鼓四轨,各轨之间边界清楚,适合整曲重编、编曲参考、素材库建设这类"要全部"的场景。如果你不知道选什么,从 Demucs 开始通常不会错。

MDX-Net:人声与伴奏的"二选一"专家

MDX-Net 是 UVR 核心团队重点训练的第二套架构,实现代码在 lib_v5/mdxnet.py,模型与参数映射记录在 models/MDX_Net_Models/ 的model_data/目录中。它输出人声 + 伴奏两轨,但把训练火力集中在这两轨上,对复杂混音(多轨叠加的摇滚、电子、现场录音)里的人声剥离往往更狠、更干净。该目录下的model_name_mapper.json列出了 UVR-MDX-NET Main、Inst HQ、Karaoke 等几十个具体权重,同一引擎下还可以按"伴奏优先"或"人声优先"挑选变体。追求单轨极致质量时优先试它。

VR Architecture:人声精提与特殊去声

VR 架构是 UVR 的元老引擎,模型放在 models/VR_Models/(含降噪模型 UVR-DeNoise-Lite.pth),它的model_data.json里能看到不少细分用途的权重:纯人声(Vocals)、卡拉 OK 伴奏、去钢琴(No Piano)、去混响(No Reverb)、去回声(No Echo)等。当你的需求很具体——"只要人声""把钢琴摘掉""去掉房间混响"——就翻 VR 这个选项卡。

一句话判断标准:要四轨选 Demucs;要干净的人声/伴奏两轨选 MDX-Net;要特殊去声或纯人声精提选 VR。三套引擎可以各跑一遍再挑最好的结果,这也是 UVR 用户常用的做法。

🎧 完成第一次人声分离:从选文件到出成品

把引擎选好后,实际的操作顺序是这样的:先点 "Select Input(s)" 挑入一首 WAV 或 MP3 文件,输入区会显示文件名和时长;接着设置输出目录,建议单独建一个文件夹放结果,输出格式上 WAV 保真度最高,MP3 文件体积更小、适合快速试听。然后切到目标引擎选项卡(比如 MDX-Net),在 Stem 选项里勾选你想保留的轨——只勾 Vocal 和 Instrumental 就只输出这两轨。最后点 "Start Processing",进度条走完即可在输出目录里听到结果。程序关闭后会自动记住你的设置,下次打开不必重调。

如果手头有多个文件要同样处理,不必一个个点:选中文件后走 "Add to Queue" 把它们排进队列,程序会按顺序依次处理,适合整张专辑级别的伴奏提取。

⚖️ 平衡音质与速度:Segment Size、Overlap 与 GPU 加速

处理速度主要由三个参数决定,理解它们的逻辑比记住具体数值更重要。

Segment Size(分段大小):长音频会被切成若干段逐段计算。分段越小,单次占用的内存和显存越少、出结果越快,但接缝处更容易出现可闻的拼接痕迹;分段越大则越连贯、越吃内存。遇到内存或显存吃紧时,第一个该动的就是它。

Overlap(重叠量):相邻分段之间的重叠比例。重叠越大,段与段衔接越平滑,但重复计算的部分也越多,耗时相应增加;重叠设得太小则接缝风险上升。默认值对多数场景已经够用,追求极致无缝时再往上加。

GPU Conversion(GPU 加速):勾选 "Use GPU for Processing" 后程序会尝试把计算交给显卡,检测不到 GPU 时自动退回 CPU。多显卡机器可以在 "GPU Device" 里指定用哪一块(0、1、2……)。CPU 模式可用但明显偏慢,长文件建议预留耐心或换机器处理。

一个实用的调参顺序:先用默认参数跑通一遍;若报内存不足,降 Segment;若嫌速度太慢且显存宽裕,开 GPU 并把 Overlap 保持默认;若对个别接缝不满意,再单独调高 Overlap 重跑。

🗂 进阶用法:批量队列与 models/ 目录

批量处理。"Add to Queue" 是 UVR 的效率入口:把多首歌曲一次加入队列后,每完成一首自动开始下一首,队列顺序即处理顺序。配合固定好输出目录与格式,整批文件的伴奏提取基本可以放着不管。

模型目录结构。首次使用某个引擎时,程序会自动下载对应权重;也可以在设置面板的 Download Center 里手动挑选。下载后的文件都落在 models/ 下,按引擎分目录存放:

  • models/Demucs_Models/:Demucs v3/v4 权重及model_data/里的名称映射;
  • models/MDX_Net_Models/:MDX-Net 各代权重、mdx_c_configs/下的模型结构 YAML 配置;
  • models/VR_Models/:VR 架构权重,包括人声精提与去噪模型。

如果你打算深挖原理,频谱变换相关的工具函数在 lib_v5/spec_utils.py,MDX-Net 的网络结构在 lib_v5/nets.py,配合model_data/里的 JSON 就能看懂每个模型"长什么样"。

🩹 踩坑速查:内存不足与非 WAV 报错怎么办

内存分配错误(Memory allocation error):这是最高频的问题,官方给出的解法就是把 Segment(或 Window)调小,同时关掉其他占用内存的大程序;显存不足时同理,也可以先切回 CPU 模式验证能否跑通。

非 WAV 文件处理失败:UVR 依赖 FFmpeg 解码 MP3、FLAC 等非 WAV 格式,FFmpeg 没装或不在程序目录里时就会报错。确认 FFmpeg 已正确安装并放在 UVR 应用目录;仍不行的话,先把文件手动转成 WAV 再处理,也可以顺带排查文件本身是否损坏。

想看具体报错细节:点 "Start Processing" 左侧的 Settings 按钮,打开 "Error Log" 查看完整错误信息,排障或向社区提问时附上它最有帮助。

CPU 模式异常慢:属正常现象,程序在 CPU 上没有 GPU 加速可用;确认显卡驱动和 CUDA 版 PyTorch 装好后勾选 GPU Conversion 重试。

写在最后

装好 UVR 5.6、按产出类型选对引擎、记住 Segment 与 Overlap 的取舍逻辑,人声分离和伴奏提取就从"玄学"变成了可重复的日常操作。先拿一首熟悉的歌跑通全流程,再逐步调参,你会很快找到适合自己硬件与听感偏好的设置组合。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询