news 2026/9/5 22:39:52

UVR|3分钟AI人声分离,一键提取卡拉OK伴奏

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
UVR|3分钟AI人声分离,一键提取卡拉OK伴奏

UVR|3分钟AI人声分离,一键提取卡拉OK伴奏

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

你刚在阳台把一首歌唱完,想抠出纯伴奏来练K歌,结果全网都只有原唱版本。UVR(Ultimate Vocal Remover)用深度神经网络做AI人声提取:把一首歌丢进去,人声和伴奏会分成两个WAV输出,通常1到3分钟就能出结果。

它帮你把任意歌曲拆成人声、伴奏两轨,省掉满世界找"无原唱版"或自学音频剪辑的麻烦。关键指标是一个数字:一首5分钟的歌,GPU上处理通常只要1到3分钟,纯CPU也要5到10分钟。

3分钟装好环境,跑通第一次分离

整个过程拆成4个动作:

  1. 拿代码。只需要一行命令:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
  1. 选安装路径。Windows和macOS用户直接按README.md里说的下载预编译包,包里已经带Python、PyTorch和全部依赖,零配置;Linux用户走项目根目录的安装脚本,它会照着requirements.txt把40多个依赖逐个装好。
  2. 启动。在项目根目录执行:
python3 UVR.py

macOS首次启动可能要等5到10分钟,别以为卡死了。

  1. 拖文件跑通。把一个WAV文件拖进主界面,选好输出目录,点"Start Processing"等进度条走完。

首次启动后,主模型文件会在应用内从Download Center自动下载,体积几十到几百MB,第一次等待稍长是正常的。别急着调参数,第一次全用默认值;应用会自动记住你的设置(存在gui_data/saved_settings/目录),下次打开不用重新选。

方案怎么选:三个引擎各管一摊

"CHOOSE PROCESS METHOD"下拉框里有三类引擎,按你的素材对号入座:

你的场景推荐引擎一句话理由
练K歌、要伴奏VR Architecture人声细节保留最好,自带Karaoke专用人声模型
流行、摇滚的人声伴奏分离MDX-Net高频分离精度高,人声残留少,最通用
拆多轨(人声/鼓/贝斯/其他)Demucs v3 / v4一次拆出4个音轨,音乐整体性好

三个引擎的模型清单都在仓库里,想确认有哪些可选:

  • VR Architecture的模型登记在models/VR_Models/model_data/model_data.json,从名字能看出用途,Instrumental、Vocals、No Piano、Noise都有。
  • MDX-Net的多轨模型看models/MDX_Net_Models/model_data/model_data.json,primary_stem字段写着它直接输出哪一路,Drums、Bass、Other都有。
  • Demucs从v1到v4的版本对照表在models/Demucs_Models/model_data/model_name_mapper.json,v4(htdemucs)的四轨能力最全。

记住一个数字就行:首选MDX-Net。效果不满意再换VR跑一遍;只有需要拆出2轨以上(比如单拿鼓组),才轮到Demucs。另外别忽略Ensemble模式:在附加设置页可以把两个模型串成主副两轮,第二轮给第一轮的输出再打磨一次,对人声提取不满意的素材,这是第一优先要试的开关。

调参实战:按顺序做4件事

调参有固定的实验链,每一步都有能听出来或看得见的反馈:

  1. 先调Segment。MDX的段长默认256,把它降到128,耗时大约减半;试听没有明显劣化就保持小值。低配机器上这是性价比最高的一刀。
  2. 再调Overlap。默认8,提到16后重点听分段交界处,边缘杂音会减少,代价是耗时增加约一成到两成。
  3. 然后决定是否开GPU。勾上"GPU Conversion"(需要NVIDIA卡,README.md给出的最低线是RTX 1060 6GB显存,8GB更稳),耗时通常缩到三分之一到五分之一。
  4. 最后考虑二次处理。把跑出来的人声丢给内置的去噪模型UVR-DeNoise-Lite(只有18MB)再分离一遍,人声轨的嘶声会明显更干净。

还有一个不用调的点:模型内部采样率是固定的(以44100 Hz为主),应用会自动重采样,别手动先转采样率,白白多一步。

两个完整工作流

把演唱会手机录音变成纯伴奏

  • 输入:4分钟演唱会录音,先转成WAV(MP3的细节已经丢了,转码救不回来)。
  • 操作:① Select Input选WAV → ② 选MDX-Net,stem选Instrumental → ③ 勾GPU Conversion → ④ Start Processing。
  • 输出:输出目录里出现原名_(Instrumental).wav原名_(Vocals).wav两个文件,伴奏可直接进K歌软件;如果还有观众欢呼残留,就用去噪模型再分离一遍。

把播客街采里的背景噪音清掉

  • 输入:15分钟街采录音,混着马路噪音和空调嗡鸣。
  • 操作:① 选VR Architecture,stem选Noise → ④ Start Processing拿到噪音成分轨 → ③ 换内置去噪模型对原文件再分离 → ④ 检查输出目录里干净的人声轨。
  • 输出:底噪明显压低的人声轨,直接进剪辑软件,省掉单独折腾降噪插件的时间。

避坑速查

README.md的Troubleshooting区加上常见报错,最高频的就这4个:

典型症状根因修复动作
处理MP3报错缺FFmpeg装FFmpeg放入程序目录
内存分配错误段长开太大调低Segment或Window
一首歌跑30分钟GPU没启用勾选GPU Conversion(N卡)
伴奏里有人声残留引擎不匹配素材换VR或另选MDX模型再跑

搭配什么更好用

  • README.md:完整的安装细节和硬件门槛(GPU最低RTX 1060 6GB),补"装什么、要什么卡"这块短板。
  • gui_data/change_log.txt:5.5到5.6的新增项,比如MDX Batch模式、Demucs Mixer模式,补"这版新在哪"的短板。
  • separate.py:分离引擎本体的源码,想写批量处理脚本时可以直接参考它的调用逻辑。

跑完第一首之后

引擎对照表、4步调参链和避坑表,就是后续所有分离任务的全部参考资料,不需要记。现在打开应用,把你想练的那首歌拖进去,完成第一次人声提取。后续版本会继续加引擎和模型,同样4步操作能覆盖的素材会越来越多。

【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 22:39:17

钢筋目标检测专用数据集:面向工程落地的AI质检实践

简介:本资源是面向建筑行业AI视觉应用的钢筋目标检测专用数据集,适用于YOLO系列模型训练与多类目标检测研究,解决施工现场钢筋自动识别、定位与计数等工程痛点。压缩包共2000个文件,含1028张真实场景JPG图像、对应YOLO格式TXT标注…

作者头像 李华
网站建设 2026/9/5 22:37:51

DataEase 3D 地图大屏完整指南:从数据准备到动态可视化一次讲清

DataEase 3D 地图大屏完整指南:从数据准备到动态可视化一次讲清 【免费下载链接】dataease 🔥 人人可用的开源 BI 工具,数据可视化神器。An open-source BI tool alternative to Tableau. 项目地址: https://gitcode.com/GitHub_Trending/d…

作者头像 李华
网站建设 2026/9/5 22:37:41

PyTorch手语识别工程实践:从数据清洗到端侧部署

简介:本资源是一套面向高校计算机专业本科生的Python毕业设计项目,基于PyTorch实现连续手语识别,旨在解决听障人士与智能系统间的自然语言交互难题,适用于深度学习课程设计、毕设开发及人机交互方向实践。压缩包共47个文件&#x…

作者头像 李华