UVR5 人声分离实战教程:5 步把任意歌曲拆成干声和伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
想翻唱却没有伴奏? 剪视频被 BGM 人声干扰? 做混音又拿不到干净的干声?
这些问题都可以交给 Ultimate Vocal Remover(UVR5)——一款免费、开源、带图形界面的 AI 人声分离工具。它把 MDX-Net、Demucs、VR 三大算法家族和几十个预训练模型装进同一个窗口,点几下按钮就能拿到分轨结果。
5 分钟跑起来
路径 A:官方整合包(零依赖)。到 UVR5 的发布页下载对应系统的安装包,Python、PyTorch、FFmpeg 全部内置,装完直接打开就能用。Windows 用户注意:整合包必须装在 C 盘,装到别的盘会出现运行不稳定的问题。
路径 B:源码运行。如果你已经配好 Python 环境,两行命令就能启动:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui pip install -r requirements.txt装完依赖后执行python3 UVR.py(Linux 需先装 FFmpeg 和 python3-tk)。有 NVIDIA 显卡的话,把 PyTorch 换成 CUDA 版本,推理速度通常能快 3-10 倍:
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117两个高频坑:pip 报权限错误时加
--user或改用虚拟环境;处理 MP3、FLAC 等格式依赖 FFmpeg,缺失时会直接报转换错误。
第一次人声分离:5 步走完
- 加载音频:点击 Select Input,选中要处理的歌曲(MP3、WAV、FLAC 都可以)
- 设定输出:点击 Select Output,选择结果保存目录和输出格式
- 选择算法:在 CHOOSE PROCESS METHOD 选 MDX-Net,模型挑一个人声/伴奏两轨分离的型号(比如带 InstVoc 字样的 HQ 版本)
- 设置参数:Segment Size 保持默认 256,Overlap 填 0.25;有独显就勾上 GPU Conversion
- 开始处理:点击 Start Processing,等进度条跑完
完成后,输出目录里会多出两个文件,例如歌曲名_(Vocals).wav和歌曲名_(Instrumental).wav——前者是干声,后者就是你要的纯净伴奏。
建议先勾上 Sample Mode,程序只处理前 30 秒。试听没问题再跑全长,调参阶段能省掉大量等待。
和老办法"消人声"差在哪
以前播放器里的"消人声"本质是频段切除:把人声常用的频率段一刀切掉。可人声和吉他泛音、键盘和声挤在同一片频率里,切掉它,整段伴奏都会发闷发空,像隔着一层被子听歌,编曲越密的歌翻车越狠。
UVR5 的路数完全不同。模型在海量带标注音频上学过"人声和每种乐器在时间、频率上怎么组合",推理时按声源归属切分。一句话概括:它做的是按来源分离,而不是挖掉一段频谱,所以伴奏能保住接近原曲的完整度。
什么素材配什么模型
| 模块 | 特长 | 适用素材/场景 |
|---|---|---|
| MDX-Net(lib_v5/mdxnet.py) | 推理快、两轨分离稳 | 流行、摇滚等常规歌曲,日常出活 |
| Demucs v3/v4(demucs/) | 支持 4 轨:人声/鼓/贝斯/其他 | 编曲复杂、需要整曲分轨的作品 |
| VR Architecture(lib_v5/vr_network/) | 模型多,有专项模型 | 去除特定乐器、降噪预处理 |
按素材选型的三条经验:
- 流行、摇滚类:优先 MDX-Net 两轨人声模型,效果和速度最均衡
- 古典、爵士或配器复杂的歌:换 Demucs v4,多轨下更稳
- 只想去掉某件乐器(比如钢琴):用 VR 系列的专项模型;素材底噪大的话,先拿 VR_Models 里的
UVR-DeNoise-Lite.pth降噪一遍再分离
所有模型都放在models/下的三个子目录里,每个模型的参数(mdx_dim_f_set、primary_stem、是否 karaoke 模式等)都写在 model_data.json 里,拿不准时直接打开看看它的设计取向。首次运行会自动下载模型,网络不畅就手动放进对应目录。
关键参数与微调
| 参数 | 推荐值 | 效果说明 |
|---|---|---|
| Segment Size | 128 / 256 / 512 | 越小越省内存,老机器选 128;越大质量上限越高,但显存吃得越狠 |
| Overlap | 0.25-0.50 起步 | 重叠窗口越大,段与段之间拼接越平滑,耗时也越长 |
| GPU Conversion | 有独显就勾 | 程序(separate.py 里的设备检测逻辑)会自动识别 CUDA 和 Mac 的 MPS,可用时优先走 GPU |
- 结果里听到"咔哒"声或段落感 → 把 Overlap 加到 0.75 再试
- 显存不足、内存报错 → 把 Segment Size 从 512 降到 256 甚至 128
文件多也不怕:队列支持批量排队,多个音源依次处理不用反复操作。
翻车急救:出错先查这里
| 现象 | 常见原因 | 对策 |
|---|---|---|
| 界面完全打不开 | 缺少 tkinter 组件 | Linux 装python3-tk后重试 |
| 处理 MP3/FLAC 时报转换错误 | 没装 FFmpeg | 安装 FFmpeg 并把可执行文件放进 UVR 主目录 |
| 首次启动极慢或模型下载失败 | 网络问题 | 手动下载模型文件放进 models/ 对应目录 |
| macOS 上点不开或左键失灵 | 系统安全策略拦截 | 按提示用spctl与xattr命令放行,或升级到最新版 |
| 内存分配错误 | Segment 开得过大 | 调小 Segment / Window 尺寸 |
| Windows 启动即闪退 | 缺 VC++ 运行库 | 安装 Visual C++ 运行库再试 |
报错详情可以点开 Start Processing 左侧的设置按钮,找 Error Log 查看完整日志,比猜原因快得多。
拿一首你最熟的流行 MP3 开练:先勾 Sample Mode 跑 30 秒,确认伴奏干净了再跑全长。当第一次听到"干净得像官方发行版"的伴奏时,你就会明白这套免费工具值不值得收藏。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考