这次我们来看一个和之前不太一样的投稿:【Obsidian】アイ·アイ·ア【UTAUCOVER】。
它不是新模型发布,也不是一键部署工具,而是一首基于 UTAU 声库 Obsidian 的日文翻唱作品。如果你平时主要关注本地部署、AI 生成、接口调用这些内容,可能觉得 UTAU 离得很远。但实际拆开看,一首 UTAU 翻唱的完整流程,和跑一个开源 TTS 项目的链路非常像:素材准备、参数调优、批处理渲染、后期混音、视频合成,每一步都能对应到工程化操作。
这篇文章就用这首《アイ·アイ·ア》翻唱作为案例,完整拆解从 UST 工程搭建、声库调教、frq 文件处理、混音导出到视频成片的全流程。重点会落在可复现的操作上:哪些文件是必要的、哪些参数影响音高和辅音、批处理怎么跑、混音阶段怎么避免爆音、投稿前需要检查什么。适合正在学习 UTAU 调声、想用 Obsidian 或其他日文声库做翻唱投稿的读者。
1. UTAU 翻唱项目核心能力速览
先给一张速览表,把这类 UTAU 翻唱项目的技术构成说清楚:
| 能力项 | 说明 |
|---|---|
| 工程类型 | UTAU 翻唱音频 + 视频投稿 |
| 使用工具 | UTAU(调声引擎)、UTAU 声库 Obsidian、视频剪辑软件、音频后期软件 |
| 核心输入 | UST 工程文件、原曲伴奏、歌词音素序列、声库 oto.ini 配置 |
| 核心输出 | 调声后的 WAV、混音成曲、视频成片 |
| 适合场景 | 翻唱投稿、声库音色测试、调声技术练习 |
| 硬件要求 | 普通 PC 即可,UTAU 对显卡没有依赖;视频合成阶段看剪辑软件要求 |
| 是否支持批量 | UTAU 可以用批处理渲染多个片段 |
| 是否支持 API | UTAU 本身是桌面工具,不提供 HTTP 接口;但音素级工程文件是文本格式,可用脚本批量修改 |
这张表想说明一件事:UTAU 翻唱的门槛不在显卡,也不在能不能跑大模型,而在你是否愿意处理工程细节。
Obsidian 这个声库在 UTAU 圈内比较常见,属于日文连续音或单独音声库,具体音素质量和 oto 配置,需要下载后逐个试听确认。不同版本、不同配布页的 Obsidian 声库,音色和 oto.ini 可能不一样,安装时要以实际压缩包说明为准。
2. 适用场景与使用边界
UTAU 翻唱适合谁?
- 想做日文翻唱但没有录音条件的人,用现成声库替代人声。
- 想研究声库调教、学习日语发音音素的人。
- 想产出二次元风格翻唱投稿,但不熟悉 MIDI 和 VST 插件的人。
- 想测试 Obsidian 或其他 UTAU 音色适合什么曲风的人。
它能解决什么问题?
UTAU 最大的价值是把“歌手”变成了文件。你不用约棚、不用录音,只需要一个做好的 UST 工程,再加上对应声库,就能批量渲染出多版人声。这对做翻唱草稿、PV 预览、多人合唱拆分来说非常方便。
不适合什么场景?
- 追求真人演唱质感的商业级作品。UTAU 调声上限不低,但入门阶段很难和大厂 VOCALOID 或真人修音相比。
- 需要中文发音的歌曲。Obsidian 偏日文音素,中文歌强行用日文音素拼,会得到很不自然的“日式中文”。
- 对实时性有要求的场景。UTAU 不是实时演唱工具,它是离线渲染工具。
合规与授权边界。
翻唱投稿本身涉及原曲著作权,各平台对翻唱投稿的规定不一样,做 UTAU 翻唱时要注意几点:
- 原曲伴奏和使用范围要确认,不能直接拿商业伴奏做无授权商用。
- 声库 Obsidian 的配布协议要仔细读,部分 UTAU 声库禁止商用、禁止二次配布、禁止用于特定内容。
- 如果作品包含人物立绘、背景素材、PV 素材,同样要确认素材授权。
- 翻唱作品属于二次创作,发布平台和原作者规则允许的情况下进行,不要用于商业广告、虚拟主播商用直播背景音乐等场景。
3. UTAU 本地部署环境准备
UTAU 的“环境准备”比 AI 模型简单很多,核心是四件事:安装 UTAU 引擎、安装声库、准备 UST 工程文件、准备伴奏和歌词。
3.1 安装 UTAU 主程序
UTAU 是 Windows 平台日本开发者制作的开源免费软件,官方日文版界面为主。中文用户可以使用 UTAU 汉化版或使用简体中文补丁,安装路径里最好不要出现全角字符和特殊符号。
建议安装后确认几件事:
- resampler.exe 是否存在。UTAU 通过 resampler 把音素采样成实际发音,缺少它会导致渲染失败。
- wavtool.exe 是否存在。它负责把 resampler 生成的短音拼接成完整 WAV。
- 声库目录是否放在 UTAU 的 voice 文件夹内,且文件夹名不含特殊字符。
3.2 安装 Obsidian 声库
Obsidian 声库和普通 UTAI 声库一样,基本结构包括:
- 一个文件夹,里面是 oto.ini 和大量 wav 音源文件。
- 可能有 readme.txt 或 license.txt,记录配布条件。
把整个声库文件夹复制到 UTAU 安装目录下的voice文件夹:
# 假设 UTAU 安装在 D:\UTAU D:\UTAU\voice\Obsidian\复制完成后,重新打开 UTAU,在歌手列表里应该能看到 Obsidian。如果看不到,检查声库文件夹下是否有 oto.ini,以及 oto.ini 是否损坏。
3.3 准备 UST 工程文件
UST 是 UTAU 自己的工程文件格式,记录音符、歌词、音素、参数曲线。可以在 UTAU 里手动输音符,也可以从其他工程导入。如果是从网上下载别人做的 UST,打开后要确认:
- 声库是否切换成了 Obsidian。
- 音符对应的假名是否和 Obsidian 的音素表一致。
- 有没有残留的 preutterance、overlap 等调声参数,这些参数在不同声库之间不能直接通用。
3.4 准备伴奏和歌词
伴奏建议用无损 WAV,避免二次压缩影响混音。歌词需要拆成 UTAU 能识别的假名或罗马音。Obsidian 如果是日文单独音声库,通常需要写平假名歌词,UTAU 会自动转换为音素,也可以在歌词里直接写音素。
如果手头没有带假名的歌词,先把罗马音转平假名,再粘贴进 UTAU。
4. UTAU 工程搭建与调声操作
这一步是整首翻唱的技术核心,包含导入工程、检查音素、调整参数、渲染试听几个阶段。
4.1 创建或导入 UST
在 UTAU 中新建工程,然后把伴奏拖入“伴奏”区域,将音符写入“音符”区。如果是从现成 UST 导入,打开后先全选音符,在歌手框里统一切换为 Obsidian。
一个比较稳妥的初步流程:
- 打开 UTAU,新建工程。
- 载入伴奏 WAV。
- 在音符轨道粘贴歌词假名。
- 全选音符,切换歌手为 Obsidian。
- 播放试听,检查发音是否匹配。
- 根据音高曲线微调 pitchbend。
4.2 了解 Obsidian 的 oto.ini
UTAU 声库发音靠 oto.ini 定义每个音源的采样起点、终点、辅音位置和预发声。Obsidian 的 oto.ini 是在声库制作阶段就写好的,正常情况不需要大改,但遇到发音闷、辅音跟不上时,可以打开 oto.ini 手动微调。
oto.ini 可手动编辑,以某一行示例:
あ=a.wav=0,100,0,50,0 い=i.wav=0,80,20,60,0这里面的五个数字从左到右分别是:
- 固定区间起点(Fixed)
- 实际采样起点(Offset)
- 辅音长度(Consonant)
- 预发声(Preutterance)
- 重叠(Overlap)
如果某个假名发音把上一个音的尾巴吃掉太多,可以调小 overlap;如果发音延迟,可以调大 preutterance。注意:每次修改 oto.ini 后,要在 UTAU 里重新加载声库,修改才对当前工程生效。
4.3 检查音素和假名
Obsidian 是日文声库,歌词必须写成平假名或对应罗马音,不能直接写汉字。UTAU 自带假名转音素功能,但不同声库对同一个假名的音素切分可能不同。
一个常见的错误是:し在 UTAU 里被拆成s i,但如果 Obsidian 的音素表里有单独的し音源,而 UTAU 没有正确匹配,就会变成用s和i两个音源拼接,听感明显不对。遇到这种情况,先确认 Obsidian 的 voice 文件夹里有没有し.wav,有的话,把歌词改成音素し,而不是s i。
更稳妥的做法是下载 UST 后逐段试听。
4.4 调节旋律和参数
UTAU 输出听起来是否自然,除了声库本身,主要看三个参数:
- pitchbend(音高滑音)
- 音量包络
- 辅音速度
在音符属性面板中,双击音符可以打开包络编辑窗口。这里能画 pitchbend 曲线,可以实现从低音滑到高音、句尾自然下滑等效果。
对 UTAU 新手,不要一开始追求复杂曲线,先做两件事:
- 把每句的句尾设置轻微 pitchbend 下滑,避免唱词结尾太硬。
- 检查所有音符的
音量参数,不要有大突兀跳跃。
4.5 渲染试听
调完一段后,可以选中片段,执行“渲染 wav 文件”。UTAU 默认会调用 resampler 生成整段音频,然后可以用 wavtool 拼进伴奏里试听。
如果渲染结果里有明显的沙哑或杂音,不要盲目加效果器,先回到 oto.ini 和音素检查阶段。
5. frq 文件与音源预处理
UTAU 中很多声库第一次使用时,会因为缺少 frq 文件导致渲染延迟或共振峰计算异常。frq 文件是 UTAU 用来保存音源基频分析结果的文件,通常和 wav 文件同名,后缀是.frq。
5.1 生成 frq 文件
第一次使用 Obsidian 声库时,UTAU 会自动分析音频并生成 frq。如果声库里的 frq 是旧的、和 wav 不匹配,渲染时可能发出异常音高。
批量生成 frq 最快的方法,是直接让 UTAU 在渲染时自动生成,或用预览功能批量触发一次。也可以在 UTAU 安装目录下用命令行调用 resampler 做一次强制分析:
resampler.exe "D:\UTAU\voice\Obsidian\あ.wav" "out.wav" 60 100 0 1 0 0 0上面命令的意义是:把あ.wav作为输入,输出out.wav,音高为 MIDI 60,速度为 100。实际跑一次之后,UTAU 会为あ.wav生成对应的あ.wav.frq。这个方法适合批量验证声库是否可用。
5.2 删除损坏的 frq
如果某个音的渲染结果一直不对,可以把对应.frq删除,让 UTAU 重新分析。不要一次把整个声库的 frq 全删掉,那样首次渲染会变慢很多。
5.3 声库音源文件检查
Obsidian 声库刚下载时,如果发现某个假名没有发音,检查对应 wav 文件是否存在。部分配布声库会切分音素到不同子文件夹,UTAU 对这些路径的兼容性一般,最好的方式是保持文件夹结构不变,不要手动重命名。
6. 混音与后期导出
调声完成后,UTAU 里可以导出人声干声 WAV。后续混音通常在另一个软件里做,比如 Audacity、FL Studio、Cubase 或免费的 DaVinci Resolve。
6.1 导出人声干声
在 UTAU 中全选音符,执行渲染。生成的是单轨 WAV,默认质量取决于 UTAU 工程设置,建议导出时选择 24bit 或 16bit WAV,采样率与伴奏保持一致。
导出后人工试听,重点检查三处:
- 是否有人声和伴奏节奏对不齐。
- 是否有辅音吞掉了前一个字的尾音。
- 是否有整体音高偏低或偏高。
6.2 混音处理流程
《アイ・アイ・ア》这类偏活泼的日文歌曲,混音不需要复杂,但有几个基础步骤值得做:
- 人声轨和伴奏轨分别做电平标准化,避免一开始就有大音量差。
- 人声轨加轻量压缩,控制动态。
- 增加一点混响,让干声不闷。
- 做响度匹配,参考平台投稿标准,不需要追求极端响度。
如果使用 Audacity,可以这样操作:
1. 导入伴奏 WAV 和人声 WAV。 2. 选中人声轨,效果 -> 压缩器。 3. 再选中人声轨,效果 -> 混响。 4. 播放试听,调整音量平衡。 5. 导出为最终 WAV。6.3 避免爆音
UTAU 渲染出的干声如果本身接近 0dB,叠加伴奏后就容易爆音。混音时先把所有轨道的峰值控制在 -3dB 以下,导出时不要开响度最大化。
判断爆音的方法很简单:看波形是否顶到上下边界,或播放时喇叭出现明显失真。
7. 视频合成与投稿准备
音频完成后,做视频成片。UTAU 翻唱常见的视频形式包括:
- 静态图 + 歌词字幕。
- 简单 PV 动画,比如背景颜色随节奏变化。
- 使用原曲 PV 素材做二次剪辑,但这种方式授权风险高,不建议。
7.1 用 ffmpeg 合成静态图视频
如果只是做一个静态歌词视频,可以用 ffmpeg 快速合成:
ffmpeg -loop 1 -i cover.png -i final_audio.wav -c:v libx264 -tune stillimage -c:a aac -b:a 192k -pix_fmt yuv420p -shortest output.mp4这里cover.png是一张封面图,final_audio.wav是混音完成的音频。
7.2 检查视频参数
投稿到视频平台前,确认:
- 分辨率至少 1080x1080 或 1920x1080。
- 音频码率不要低于 192k。
- 视频时长和音频完全一致。
- 封面文字不要遮挡重要画面。
7.3 投稿信息填写
标题可以直接沿用原投稿标题,比如 【Obsidian】アイ·アイ·ア【UTAUCOVER】。简介里建议写清楚:
- 使用的声库名称。
- 原曲名称和原作者。
- UST 来源或调声作者。
- 伴奏来源。
- 禁止事项说明,如果声库协议有规定。
8. 资源占用与性能观察
UTAU 渲染不依赖 GPU,核心瓶颈在 CPU 单核性能和音频文件读取速度。批量渲染多首歌曲时,以下表现比较常见:
- 首次渲染时,声库缺少 frq,每个音源都要做基频分析,耗时明显增加。
- 后续渲染变快,因为 frq 已生成。
- 单颗 CPU 性能越强,速度越快;多核并行对单个工程帮助有限,但可以让多个 UTAU 实例并行渲染不同片段。
- 内存占用通常很低,一般不会超过 2GB,主要取决于工程音频片段数量和伴奏长度。
如果你的目标是批量翻唱多首歌,可以把 UTAU 渲染当作纯 CPU 任务,观察任务管理器里 CPU 使用率和磁盘读写。如果某个片段渲染时间异常长,优先检查该片段是否调用了不存在的音源,导致 UTAU 反复尝试重新分析。
8.1 降低渲染耗时的做法
- 先渲染
试听模式,确认音调和发音没问题,再渲染完整工程。 - 工程里的参数曲线越复杂,渲染越慢,但差别不大,不用为了速度过度精简。
- 如果声库文件夹在机械硬盘上,可以把整套 UTAU 和声库放到 SSD,能明显减少读取时间。
8.2 显存占用说明
UTAU 翻唱流程不涉及显卡推理,显存占用为 0。后期视频合成如果使用 DaVinci Resolve 等软件,显存占用取决于视频分辨率和特效数量,和 UTAU 无关。
9. 常见问题与排查方法
UTAU 翻唱制作中遇到的多数问题,都可以通过日志、文件检查定位。下面列一张常见问题表:
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 打开 UST 后没有声音 | 歌手未切换到 Obsidian | 检查音符的歌手属性 | 全选音符并切换歌手 |
| 某个假名发音为空 | 声库缺少对应音源文件 | 打开 voice 文件夹检查对应 wav | 换用同义音素或补齐音源 |
| 渲染时提示 resampler 错误 | resampler.exe 缺失或路径错误 | 检查 UTAU 安装目录 | 重新安装 UTAU |
| 人声和伴奏对不齐 | 音符位置和伴奏节奏不匹配 | 播放试听定位偏差 | 移动音符或调整 BPM |
| 渲染出来的音高明显不对 | frq 文件损坏或与 wav 不匹配 | 删除对应 frq 后重新渲染 | 必须找到具体音源路径 |
| 混音后爆音 | 人声或伴奏峰值过高 | 查看波形峰值 | 标准化到 -3dB 以下重新导出 |
| 视频投稿后音画不同步 | 视频时长和音频时长不一致 | 检查最终 mp4 时长 | 用 ffmpeg 重导出并加上-shortest |
| 声库导入后 UTAU 列表不显示 | 文件夹结构和 oto.ini 缺失 | 检查 voice 目录 | 把声库文件夹放到正确位置 |
9.1 依赖安装失败怎么办
UTAU 本身没有复杂的 Python 依赖,但如果你的 UTAU 是通过汉化版或整合包安装的,遇到启动失败,优先检查:
- 是否安装 Microsoft Visual C++ 运行库。
- UTAU 安装路径是否包含中文、空格以外的特殊字符。
- 杀毒软件是否拦截了 resampler.exe 和 wavtool.exe。
9.2 声库损坏怎么办
如果下载的 Obsidian 声库解压后缺少 oto.ini,可以从配布页面重新下载,不要自行从其他版本复制 oto.ini 替换,不同版本声库的 oto.ini 通常不通用。
10. 最佳实践与使用建议
把一次 UTAU 翻唱做成可复用的生产流程,建议提前规划目录结构:
Song01/ ├── UST/ │ └── original.ust ├── Voice/ │ └── Obsidian/ ├── Mix/ │ ├── vocal_raw.wav │ ├── vocal_processed.wav │ ├── accompaniment.wav │ └── final.wav ├── Video/ │ ├── cover.png │ └── output.mp4 └── Notes.md工程管理上建议注意几点:
- 第一次拿到新声库时,先渲染一小段测试音频,确认音色和发音机制,不要直接导入整首歌。
- 保留一份未修改的 UST 备份,调坏参数可以快速还原。
- 每调完一句就渲染试听,不要等整首调完再听,否则问题定位成本非常高。
- 批量做多首歌时,每首歌单独建工程文件夹,不要把所有素材混在一起。
- 混音输出时保留干声和最终混音两个版本,方便后续重新混音。
内容合规上也给出明确建议:
- 使用 Obsidian 声库前,仔细阅读声库自带的 license 文件,确认是否可以商用、是否允许二次调声发布。
- 翻唱作品发布时标注原曲和声库信息,是对原作者的尊重。
- 不要在直播、商用视频中使用未经授权的伴奏和音源。
- 如果作品涉及他人背景素材、立绘,需确认素材来源和授权。
11. 总结与下一步
这首《アイ・アイ・ア》的 Obsidian UTAU 翻唱,表面看是一次声音合成,实际上是一条完整的本地音频生产链路:声库安装、UST 工程调整、oto.ini 检查、frq 生成、渲染、混音、视频合成。在任何一步卡住,最后都体现在输出质量上,所以每一步都要用试听来验证。
最值得先尝试的是用 Obsidian 渲染一段 10 秒以内的短句,体会音素匹配、frq 生成和渲染流程,然后再扩展到完整歌曲。最容易踩的坑有两个:一是歌词假名写错导致音素不匹配,二是声库 oto.ini 和工程参数冲突导致发音奇怪。
下一步如果想提升调声质量,可以重点研究 UTAU 的音高曲线绘制和参数自动化,也可以试试用脚本批量修改 UST 来生成多版本人声。后续如果对工具链感兴趣,还能把 UTAU 干声导入到作曲软件里继续混音,或者结合本地音乐生成模型做伴奏分离。
把这套流程跑通一遍之后,你会发现 UTAU 翻唱本质上和跑一个开源 TTS 项目没什么区别:输入素材、调参、批量渲染、检查输出。只是这次,你要调的音色不是别人的预训练模型,而是你自己决定怎么唱的一堆 wav 文件。