UVR|3分钟AI人声分离,一键提取卡拉OK伴奏
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
你刚在阳台把一首歌唱完,想抠出纯伴奏来练K歌,结果全网都只有原唱版本。UVR(Ultimate Vocal Remover)用深度神经网络做AI人声提取:把一首歌丢进去,人声和伴奏会分成两个WAV输出,通常1到3分钟就能出结果。
它帮你把任意歌曲拆成人声、伴奏两轨,省掉满世界找"无原唱版"或自学音频剪辑的麻烦。关键指标是一个数字:一首5分钟的歌,GPU上处理通常只要1到3分钟,纯CPU也要5到10分钟。
3分钟装好环境,跑通第一次分离
整个过程拆成4个动作:
- 拿代码。只需要一行命令:
git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui- 选安装路径。Windows和macOS用户直接按README.md里说的下载预编译包,包里已经带Python、PyTorch和全部依赖,零配置;Linux用户走项目根目录的安装脚本,它会照着requirements.txt把40多个依赖逐个装好。
- 启动。在项目根目录执行:
python3 UVR.pymacOS首次启动可能要等5到10分钟,别以为卡死了。
- 拖文件跑通。把一个WAV文件拖进主界面,选好输出目录,点"Start Processing"等进度条走完。
首次启动后,主模型文件会在应用内从Download Center自动下载,体积几十到几百MB,第一次等待稍长是正常的。别急着调参数,第一次全用默认值;应用会自动记住你的设置(存在gui_data/saved_settings/目录),下次打开不用重新选。
方案怎么选:三个引擎各管一摊
"CHOOSE PROCESS METHOD"下拉框里有三类引擎,按你的素材对号入座:
| 你的场景 | 推荐引擎 | 一句话理由 |
|---|---|---|
| 练K歌、要伴奏 | VR Architecture | 人声细节保留最好,自带Karaoke专用人声模型 |
| 流行、摇滚的人声伴奏分离 | MDX-Net | 高频分离精度高,人声残留少,最通用 |
| 拆多轨(人声/鼓/贝斯/其他) | Demucs v3 / v4 | 一次拆出4个音轨,音乐整体性好 |
三个引擎的模型清单都在仓库里,想确认有哪些可选:
- VR Architecture的模型登记在models/VR_Models/model_data/model_data.json,从名字能看出用途,Instrumental、Vocals、No Piano、Noise都有。
- MDX-Net的多轨模型看models/MDX_Net_Models/model_data/model_data.json,primary_stem字段写着它直接输出哪一路,Drums、Bass、Other都有。
- Demucs从v1到v4的版本对照表在models/Demucs_Models/model_data/model_name_mapper.json,v4(htdemucs)的四轨能力最全。
记住一个数字就行:首选MDX-Net。效果不满意再换VR跑一遍;只有需要拆出2轨以上(比如单拿鼓组),才轮到Demucs。另外别忽略Ensemble模式:在附加设置页可以把两个模型串成主副两轮,第二轮给第一轮的输出再打磨一次,对人声提取不满意的素材,这是第一优先要试的开关。
调参实战:按顺序做4件事
调参有固定的实验链,每一步都有能听出来或看得见的反馈:
- 先调Segment。MDX的段长默认256,把它降到128,耗时大约减半;试听没有明显劣化就保持小值。低配机器上这是性价比最高的一刀。
- 再调Overlap。默认8,提到16后重点听分段交界处,边缘杂音会减少,代价是耗时增加约一成到两成。
- 然后决定是否开GPU。勾上"GPU Conversion"(需要NVIDIA卡,README.md给出的最低线是RTX 1060 6GB显存,8GB更稳),耗时通常缩到三分之一到五分之一。
- 最后考虑二次处理。把跑出来的人声丢给内置的去噪模型UVR-DeNoise-Lite(只有18MB)再分离一遍,人声轨的嘶声会明显更干净。
还有一个不用调的点:模型内部采样率是固定的(以44100 Hz为主),应用会自动重采样,别手动先转采样率,白白多一步。
两个完整工作流
把演唱会手机录音变成纯伴奏
- 输入:4分钟演唱会录音,先转成WAV(MP3的细节已经丢了,转码救不回来)。
- 操作:① Select Input选WAV → ② 选MDX-Net,stem选Instrumental → ③ 勾GPU Conversion → ④ Start Processing。
- 输出:输出目录里出现
原名_(Instrumental).wav和原名_(Vocals).wav两个文件,伴奏可直接进K歌软件;如果还有观众欢呼残留,就用去噪模型再分离一遍。
把播客街采里的背景噪音清掉
- 输入:15分钟街采录音,混着马路噪音和空调嗡鸣。
- 操作:① 选VR Architecture,stem选Noise → ④ Start Processing拿到噪音成分轨 → ③ 换内置去噪模型对原文件再分离 → ④ 检查输出目录里干净的人声轨。
- 输出:底噪明显压低的人声轨,直接进剪辑软件,省掉单独折腾降噪插件的时间。
避坑速查
README.md的Troubleshooting区加上常见报错,最高频的就这4个:
| 典型症状 | 根因 | 修复动作 |
|---|---|---|
| 处理MP3报错 | 缺FFmpeg | 装FFmpeg放入程序目录 |
| 内存分配错误 | 段长开太大 | 调低Segment或Window |
| 一首歌跑30分钟 | GPU没启用 | 勾选GPU Conversion(N卡) |
| 伴奏里有人声残留 | 引擎不匹配素材 | 换VR或另选MDX模型再跑 |
搭配什么更好用
- README.md:完整的安装细节和硬件门槛(GPU最低RTX 1060 6GB),补"装什么、要什么卡"这块短板。
- gui_data/change_log.txt:5.5到5.6的新增项,比如MDX Batch模式、Demucs Mixer模式,补"这版新在哪"的短板。
- separate.py:分离引擎本体的源码,想写批量处理脚本时可以直接参考它的调用逻辑。
跑完第一首之后
引擎对照表、4步调参链和避坑表,就是后续所有分离任务的全部参考资料,不需要记。现在打开应用,把你想练的那首歌拖进去,完成第一次人声提取。后续版本会继续加引擎和模型,同样4步操作能覆盖的素材会越来越多。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考