news 2026/9/6 20:53:42

UVR5 人声分离实战教程:5 步把任意歌曲拆成干声和伴奏

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
UVR5 人声分离实战教程:5 步把任意歌曲拆成干声和伴奏

UVR5 人声分离实战教程:5 步把任意歌曲拆成干声和伴奏

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

想翻唱却没有伴奏? 剪视频被 BGM 人声干扰? 做混音又拿不到干净的干声?

这些问题都可以交给 Ultimate Vocal Remover(UVR5)——一款免费、开源、带图形界面的 AI 人声分离工具。它把 MDX-Net、Demucs、VR 三大算法家族和几十个预训练模型装进同一个窗口,点几下按钮就能拿到分轨结果。

5 分钟跑起来

路径 A:官方整合包(零依赖)。到 UVR5 的发布页下载对应系统的安装包,Python、PyTorch、FFmpeg 全部内置,装完直接打开就能用。Windows 用户注意:整合包必须装在 C 盘,装到别的盘会出现运行不稳定的问题。

路径 B:源码运行。如果你已经配好 Python 环境,两行命令就能启动:

git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui pip install -r requirements.txt

装完依赖后执行python3 UVR.py(Linux 需先装 FFmpeg 和 python3-tk)。有 NVIDIA 显卡的话,把 PyTorch 换成 CUDA 版本,推理速度通常能快 3-10 倍:

pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117

两个高频坑:pip 报权限错误时加--user或改用虚拟环境;处理 MP3、FLAC 等格式依赖 FFmpeg,缺失时会直接报转换错误。

第一次人声分离:5 步走完

  1. 加载音频:点击 Select Input,选中要处理的歌曲(MP3、WAV、FLAC 都可以)
  2. 设定输出:点击 Select Output,选择结果保存目录和输出格式
  3. 选择算法:在 CHOOSE PROCESS METHOD 选 MDX-Net,模型挑一个人声/伴奏两轨分离的型号(比如带 InstVoc 字样的 HQ 版本)
  4. 设置参数:Segment Size 保持默认 256,Overlap 填 0.25;有独显就勾上 GPU Conversion
  5. 开始处理:点击 Start Processing,等进度条跑完

完成后,输出目录里会多出两个文件,例如歌曲名_(Vocals).wav歌曲名_(Instrumental).wav——前者是干声,后者就是你要的纯净伴奏。

建议先勾上 Sample Mode,程序只处理前 30 秒。试听没问题再跑全长,调参阶段能省掉大量等待。

和老办法"消人声"差在哪

以前播放器里的"消人声"本质是频段切除:把人声常用的频率段一刀切掉。可人声和吉他泛音、键盘和声挤在同一片频率里,切掉它,整段伴奏都会发闷发空,像隔着一层被子听歌,编曲越密的歌翻车越狠。

UVR5 的路数完全不同。模型在海量带标注音频上学过"人声和每种乐器在时间、频率上怎么组合",推理时按声源归属切分。一句话概括:它做的是按来源分离,而不是挖掉一段频谱,所以伴奏能保住接近原曲的完整度。

什么素材配什么模型

模块特长适用素材/场景
MDX-Net(lib_v5/mdxnet.py)推理快、两轨分离稳流行、摇滚等常规歌曲,日常出活
Demucs v3/v4(demucs/)支持 4 轨:人声/鼓/贝斯/其他编曲复杂、需要整曲分轨的作品
VR Architecture(lib_v5/vr_network/)模型多,有专项模型去除特定乐器、降噪预处理

按素材选型的三条经验:

  • 流行、摇滚类:优先 MDX-Net 两轨人声模型,效果和速度最均衡
  • 古典、爵士或配器复杂的歌:换 Demucs v4,多轨下更稳
  • 只想去掉某件乐器(比如钢琴):用 VR 系列的专项模型;素材底噪大的话,先拿 VR_Models 里的UVR-DeNoise-Lite.pth降噪一遍再分离

所有模型都放在models/下的三个子目录里,每个模型的参数(mdx_dim_f_set、primary_stem、是否 karaoke 模式等)都写在 model_data.json 里,拿不准时直接打开看看它的设计取向。首次运行会自动下载模型,网络不畅就手动放进对应目录。

关键参数与微调

参数推荐值效果说明
Segment Size128 / 256 / 512越小越省内存,老机器选 128;越大质量上限越高,但显存吃得越狠
Overlap0.25-0.50 起步重叠窗口越大,段与段之间拼接越平滑,耗时也越长
GPU Conversion有独显就勾程序(separate.py 里的设备检测逻辑)会自动识别 CUDA 和 Mac 的 MPS,可用时优先走 GPU
  • 结果里听到"咔哒"声或段落感 → 把 Overlap 加到 0.75 再试
  • 显存不足、内存报错 → 把 Segment Size 从 512 降到 256 甚至 128

文件多也不怕:队列支持批量排队,多个音源依次处理不用反复操作。

翻车急救:出错先查这里

现象常见原因对策
界面完全打不开缺少 tkinter 组件Linux 装python3-tk后重试
处理 MP3/FLAC 时报转换错误没装 FFmpeg安装 FFmpeg 并把可执行文件放进 UVR 主目录
首次启动极慢或模型下载失败网络问题手动下载模型文件放进 models/ 对应目录
macOS 上点不开或左键失灵系统安全策略拦截按提示用spctlxattr命令放行,或升级到最新版
内存分配错误Segment 开得过大调小 Segment / Window 尺寸
Windows 启动即闪退缺 VC++ 运行库安装 Visual C++ 运行库再试

报错详情可以点开 Start Processing 左侧的设置按钮,找 Error Log 查看完整日志,比猜原因快得多。


拿一首你最熟的流行 MP3 开练:先勾 Sample Mode 跑 30 秒,确认伴奏干净了再跑全长。当第一次听到"干净得像官方发行版"的伴奏时,你就会明白这套免费工具值不值得收藏。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 20:52:08

三步把网页视频音频存进本地:猫抓资源嗅探插件实操指南

三步把网页视频音频存进本地:猫抓资源嗅探插件实操指南 【免费下载链接】cat-catch 猫抓 浏览器资源嗅探扩展 / cat-catch Browser Resource Sniffing Extension 项目地址: https://gitcode.com/GitHub_Trending/ca/cat-catch 页面上的视频放完了&#xff0c…

作者头像 李华
网站建设 2026/9/6 20:46:51

老字号品牌网络营销破局:孔凤春的内容种草与直播电商组合策略

简介:以孔凤春为例的化妆品网络营销策略研究论文,面向市场营销、电子商务及国货品牌方向的学生与研究者,聚焦国货化妆品的电商转型难题,兼具理论与现实意义。文档基于网红经济与STP、4P等理论,通过文献分析和问卷调查&…

作者头像 李华
网站建设 2026/9/6 20:44:46

AtlasOS 完整上手指南:15 分钟完成一次可审计的 Windows 11 优化

AtlasOS 完整上手指南:15 分钟完成一次可审计的 Windows 11 优化 【免费下载链接】Atlas 🚀 An open and lightweight modification to Windows, designed to optimize performance, privacy and usability. 项目地址: https://gitcode.com/GitHub_Tre…

作者头像 李华