免费人声分离工具终极实操:Ultimate Vocal Remover GUI 从装到出音的每一步
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
想把歌曲里的原唱抠掉做伴奏,或者只留下人声做采样?Ultimate Vocal Remover GUI(下文简称 UVR)是一款免费的开源图形界面软件,用它做人声分离,选个文件、选个模型、点一下按钮就能拿到人声和伴奏两个音轨。
🚀 三步装好并跑通第一次人声分离
第一步:装好运行环境。Windows 和 macOS 用户直接到 Releases 下载对应安装包(M1/M2 芯片选 arm64,Intel 选 x86_64),双击安装即可,包里已包含 Python 和 PyTorch。Linux 用户(Debian/Ubuntu 系)手动装:
sudo apt install ffmpeg python3-pip python3-tk pip3 install -r requirements.txt python3 UVR.py克隆仓库可用:git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui。装完如果打不开 MP3、FLAC 这类非 WAV 文件,说明 FFmpeg 没就位(它负责格式转换),按 README 的说明把二进制文件放进应用目录。
第二步:选输入、定输出。打开 UVR 后,点 Select Input 选音频(可多选,多选即批量处理),用 Select Output 指定保存目录。文件也可以直接拖进界面。
第三步:点 Start Processing。默认模型、默认参数就能出结果。处理完成后,输出目录里会得到文件名_(Vocals)和文件名_(Instrumental)两个音轨,WAV、FLAC、MP3 三种格式都可选。软件会自动记住你上次的设置,下次不用重调。
🎛 核心选项速览:干什么用、怎么设、有什么效果
处理方法与模型——决定分离质量的上限。界面里三类主流架构:
- VR Arch:最省资源,适合老机器,模型文件在 models/VR_Models/;
- MDX-Net(含 MDX23C 新一代,如 MDX23C-InstVoc HQ):人声分离的主力,模型文件在 models/MDX_Net_Models/,模型名对照表见 model_name_mapper.json;
- Demucs:支持 4 轨分离(人声/鼓/贝斯/其他),v4 的 htdemucs_ft 是常见选择,模型目录在 models/Demucs_Models/。
Segment(分段大小)——管显存/内存占用的。数值越小占用越少、越稳;数值越大效果可能更好但更吃资源。MDX 类默认 256。如果遇到内存分配报错,把 Segment 或 Window 调小就能解决(这是官方排障建议)。
Overlap(重叠比例)——管分段拼接处的接缝质量。取值 0.25~0.99,默认 0.25;调到 0.5 以上边缘过渡更干净,代价是处理时间变长。MDX23C 模型的 Overlap 是 2~50 的整数,逻辑相同。
Stem 选择——决定导出哪些轨。勾选 Vocals Only 只出人声,Instrumental Only 只出伴奏,全勾则两轨都要。Normalization(输出归一化)建议保持开启,防止削波。
🎧 三个高频场景:照抄这套参数
场景一:做卡拉OK伴奏。处理方法选 MDX-Net,模型选 UVR-MDX-NET Inst 系列或 MDX23C-InstVoc HQ,Stem 只勾 Instrumental,Overlap 用默认 0.25。想要更干净的伴奏,可换用标记为 karaoke 的模型(模型数据里有专门标记),人声残留会明显减少。
场景二:提取干净人声采样。处理方法选 MDX-Net,模型选以 Vocals 为主轨的模型(如 MDX23C-InstVoc HQ),Stem 勾 Vocals。如果输出有底噪,打开 Denoise 选项——它用降噪模型清理 MDX-Net 引入的噪声,需要 UVR-DeNoise-Lite 模型(仓库 models/VR_Models/ 已自带)。
场景三:分离播客里的背景音乐。处理方法选 Demucs(v4 的 htdemucs_ft 即可),Stem 勾 All Stems。播客里人声占比高、编曲简单,Demucs 四轨输出里 Other 轨通常就是背景音乐,直接拿去调音量即可。批量处理整期节目时,一次多选文件全部拖入,按顺序自动跑完。
⚡ 进阶技巧:只讲真正影响结果的
GPU 加速。勾选 GPU Conversion 后处理由显卡承担,CPU 会慢得多。硬性门槛:NVIDIA 显卡,最低 RTX 1060 6GB,推荐 8GB 显存以上(README 里的官方说法);Mac 上仅 M1 系列芯片可用 MPS 加速,且覆盖 Demucs v4 和所有 MDX-Net 模型。AMD 显卡目前支持有限。
Ensemble 模型组合。单次分离不满意时,Ensemble 模式会让多个模型分别跑一遍再按算法(Max/Min 谱、均值等)合并结果,稳定性比单模型好,代价是耗时翻倍。配置可保存到 gui_data/saved_ensembles/,下次一键调用。
其他实用开关。Time Stretch(变速)和 Change Pitch(变调)依赖 Rubber Band 库,装好才能用;TTA(测试时增强)对 VR Arch 有效,提升质量但更耗时。自定义模型参数可看 lib_v5/vr_network/modelparams/ 下的 JSON 配置文件,一般用户不需要动。
❓ 常见问题速答
Q:处理后有残留噪声或哼鸣感?A:换架构试试——MDX 系残留重就换 Demucs,反之亦然;Overlap 调到 0.5 以上;仍不干净就上 Ensemble 组合两个模型。
Q:处理速度太慢?A:先确认 GPU Conversion 已勾选且显卡达标;再确认处理的是 GPU 支持范围内的模型(Mac 上只有 VR Arch 模型走不了 GPU)。
Q:报内存分配错误(Memory allocation error)?A:把 Segment 或 Window 调小。这是官方文档给出的标准解法。
Q:支持哪些格式?能批量吗?A:WAV 可直接处理,MP3/FLAC/OGG 等依赖 FFmpeg 转换;输出支持 WAV/FLAC/MP3。输入框多选文件或直接拖文件夹即可批量,按顺序处理。
UVR 把开源分离模型的复杂流程收敛成了三步操作,你现在就可以装好它,选一首歌跑一遍——第一轨人声出来之前,别急着调任何参数。
【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考