有声后期里,“音量忽大忽小”是我被问到最多的一个问题。无论是录有声书、播客对谈,还是做视频口播,干音往往不是整体偏小,而是某些词很炸、某些句又很虚。一集内容听下来,用户得不停调耳机音量,体验很差。送到平台后还可能因为响度不达标被拒审,或者被自动增益压得声音忽远忽近。
这个问题的本质不是简单的“音量不稳定”,而是动态范围过大。要彻底解决它,不能只靠手动拉包络线,而是要建立一套“先修复、再压缩、后限制、再响度匹配”的处理链路。这篇文章就围绕这一套链路展开,会讲清楚动态范围、响度、压缩器、限制器这些概念到底在干什么,也会以 Adobe Audition、Audacity、RX 等常见工具为例,给出可直接照做的处理步骤和参数范围。无论你是刚开始做有声后期,还是已经处理了几百集节目想优化流程,都可以用这套思路。
1. 动态范围与响度:先搞清楚问题出在哪
1.1 音量忽大忽小到底是什么意思
人耳感受到的“音量大小”并不是某一瞬间电平表跳到的那个峰值,而是声音在一段时间内给人的整体响度感受。忽大忽小通常反映的是两种情况:
一是瞬时峰值差异大。比如录音时字头“b”“p”喷麦,或者情绪激动处突然靠近话筒,导致某些音节出现很高的峰值,而旁边句子又很低。
二是长时间平均响度不稳定。比如录到中途嘴巴离话筒远了,或者房间背景噪声一会儿有一会儿无,导致整段话的听感忽远忽近。
在波形图上,前者表现为个别“尖刺”,后者表现为一段波形整体宽、一段整体细。
1.2 动态范围不是越大越好
动态范围指的是音频信号中最大声与最小声之间的差距。录音时我们当然希望保留尽可能多的细节,比如轻声的气口、尾音里的空间感,这些都属于小电平信号;但很多干音的问题就是该大的未必是有效内容,该小的又太小,导致整体动态范围失控。
举个例子:
- 最大瞬间:-3 dBFS,出现在一个咬字很重的“就”字上。
- 最轻细节:-48 dBFS,出现在句尾气息里。
- 两者差了 45 dB。
如果什么都不做直接导出,平台播放器会按照统一响度标准去衰减或增益。衰减后,轻声内容可能直接掉进底噪里;若平台做了自动增益,又会把背景噪声抬起来,形成“嘶嘶声跟着语音起伏”的怪效果。
这里要区分两个概念:
- 峰值(Peak):某一时刻波形能达到的最大数值,单位是 dBFS。
- 响度(Loudness):人耳感知到的整体音量,行业标准常用 LUFS,比如短视频平台常见目标响度为 -14 LUFS,播客常见为 -16 LUFS。
处理的目标是:把过高的峰值压下来,把过低的轻声适度抬起来,同时压低底噪,让整体响度达到一个稳定、达标的水平。
1.3 为什么不能靠“整体音量调小”
很多人发现音量忽大忽小后,第一反应是把整条音频的音量拉下来。但如果只是整体调小,峰值是降了,轻声部分也会跟着变小,依然听不清。听觉体验上没有解决“忽大忽小”,只是把整体变小了。
正确思路是分三步:
- 先把“过大”的部分通过压缩器降下来。
- 再把“过小”的部分通过增益或压缩器中的 makeup gain 抬起来。
- 最后用限制器或标准化把最终电平控制在安全范围。
这也是后期领域常说的一句话:先做动态处理,再做响度匹配。
2. 环境准备与音频体检
2.1 需要准备的工具
本文会用到三类工具,你可以根据自己习惯选择:
| 工具 | 定位 | 适用阶段 |
|---|---|---|
| Adobe Audition | 专业音频工作站,自带响度匹配、振幅与压限、多频段压缩器 | 高效处理整段音频 |
| Audacity | 开源免费,跨平台,基础压缩和限制插件齐全 | 轻量处理、学习原理 |
| iZotope RX | 修复类工具较强,也带 Dynamics 模块 | 处理口水声、爆音等顽固问题 |
| 有声书/播客剪辑插件 | 如 Auphonic、Xfer 等 | 批量响度处理,但要在端到端处理最后使用 |
本文例举的参数不是唯一标准,请以你所用工具的实际界面为准。
2.2 处理前必须做的三件事
拿到干音后,不要直接上压缩器。先完成以下检查:
- 备份原始文件。动态处理和响度优化属于破坏性编辑,做完后如果后悔再撤销,容易丢历史状态。建议先复制一份原始文件保留。
- 检查采样率和位深。比如常见的录音格式为 48 kHz/24 bit 或 44.1 kHz/24 bit,如果最后要交付给音频平台或视频剪辑,需要和平台要求保持一致。
- 先做降噪和修复。如果音频里有持续底噪、电流声、鼠标声、衣物摩擦声,建议先用降噪、去咔哒声等工具处理干净。压缩器会把背景噪声和小音量语音一起抬高,所以噪声如果没处理干净,压缩之后会更明显。
2.3 如何“看”动态范围超大的音频
在 Audition 中打开波形,把视图切换到“波形编辑器”并按V键可以预览响度直方图。通过以下特征可以快速判断:
- 波形上下出现明显削波顶端的“方块化”,说明某处录得过载了。
- 整段波形粗细变化剧烈,例如安静段落只有一格高,情绪段落却顶满到 0 dB 附近。
- 响度直方图显示分布长度很长,且左右不均衡。
如果直方图显示峰值长期贴着 0 dB,而平均响度只有 -20 LUFS 以下,那么这段音频的动态范围很可能是偏大的。
3. 核心处理器原理:压缩器、限制器、与响度匹配
在讲流程之前,先花点时间理解三个关键处理器的区别。很多人分不清压缩和限制,参数也不会调,后面的步骤就容易翻车。
3.1 压缩器(Compressor)
压缩器的作用是:当信号超过设定阈值时,自动减小增益。
关键参数有五个:
- 阈值(Threshold):达到多少 dB 以上开始压缩。
- 压缩比(Ratio):超过阈值部分的衰减比值。常见语音处理从 2:1 到 4:1 之间。
- 启动时间(Attack):信号超过阈值后,多久开始生效。太短会吃掉字头,太长又来不及压住瞬时峰值。
- 释放时间(Release):信号回落到阈值以下后,多久恢复原始增益。太短会引起“喘息效应”,太长会导致后面较小语音也被压低。
- 补尝增益(Makeup Gain):压缩会整体降低信号电平,处理后需要补回一部分增益。
对于有声读物这类以语音为主的内容,比较稳妥的起点是阈值 -20 dBFS 左右,压缩比 3:1 到 4:1,启动时间 10 ms 左右,释放时间 100 ms 到 200 ms。具体要根据素材试听调整。
3.2 限制器(Limiter)
限制器本质上是压缩比极高的压缩器,比如 20:1 甚至 ∞:1。它通常放在信号链最末端,目的是保证输出永远不会超过某个天花板,例如 -3 dBFS 或 -1 dBFS。
限制器不是用来“修忽大忽小”的,而是用来“兜底”的。如果前面的压缩已经做得不错,限制器只需要处理偶尔冒出来的极高峰值,而不是大范围工作。
3.3 响度匹配 / 标准化
动态处理结束后,我们还需要让整条音频的目标响度稳定。这里有个常见的认知误区:响度匹配不是简单把音频“调大声”,而是计算整段或整句的平均响度,再根据目标 LUFS 值做整体增益。
大多数有声制作平台或视频分发平台都会给出“目标响度”或“响度范围”的建议。常见的做法是:先将单句或段落之间响度匹配,再对整个节目做一次最终标准化。
3.4 为什么压缩顺序很重要
如果先做增益再做压缩,很容易触发压缩器误动作。比如整段音频很安静时,你先把音量拉高,底噪会跟着起来;再压缩时,底噪可能被当成有效信号,导致噪声更明显。
更优的处理顺序一般是:
- 修复工具:降噪、去口水声、去爆音。
- 单独修复个别过载或过轻片段。
- 压缩器,主要压缩峰值和动态波动。
- 如果目标响亮差异大的,可以使用多频段压缩配合。
- 限制器兜底,确保峰值不超过安全值。
- 响度标准化或响度匹配到目标值。
- 中途多听,不要只看波形。
4. 完整实战:从干音到稳定响度成品
下面以一个模拟的“有声书演播片段”为例,时长约 5 分钟,原始录音存在以下问题:
- 开头两句音量偏小;
- 中间有一句情绪激动的台词,峰值接近 -2 dBFS;
- 句尾多次出现轻微气息喷麦;
- 整体响度不均匀。
4.1 文件准备与记录
先把原始音频复制到项目目录,并建议用表格记录文件信息:
| 项目 | 内容示例 |
|---|---|
| 原始文件 | recording_raw.wav |
| 备份文件 | recording_raw_backup.wav |
| 采样率 | 48 kHz / 24 bit |
| 需要修复的问题 | 句首偏低、两处爆音、气息噪声 |
| 目标响度 | 平台要求 -16 LUFS(如有声书平台常见值,可根据你的平台调整) |
如果素材很多,建议建立类似以上的 Excel 表,防止批处理时信息丢失。
4.2 第一步:修复明显问题
用 Izotope RX 或 Audition 的“诊断”工具处理爆音。以下以 Audition 为例:
- 在波形编辑器中选中爆音区域。
- 点击菜单“效果”→“诊断”→“删除爆音”。
- 将预设改成“轻微爆音”,但不要设置太强,否则会消掉字头。
- 处理完试听一下,若有残留再逐点手动删除。
气息喷麦或低频“轰头”声,可以通过高通滤波器解决。语音内容通常在 80 Hz 以下没有有效信息,建议在 70 到 90 Hz 附近做一次高通,衰减一些超低频噪声。但不要拉太高,比如 120 Hz 以上会让人声变“薄”。
4.3 第二步:用压缩器控制主体动态
在 Audition 中选中整段,选择“效果”→“振幅与压限”→“动态处理”,切换到“压缩”预设,然后用下面的初始值:
| 参数 | 建议值 |
|---|---|
| 压缩类型 | 广谱压缩(宽带压缩) |
| 阈值 | -20.0 dB |
| 压缩比 | 3.5:1 |
| 启动时间 | 10 ms |
| 释放时间 | 150 ms |
| 输出增益 | +3 dB |
先试听 “情绪激烈一句”和“轻声一句”,观察电平表。
如果轻声部分仍然偏低,可以再增加一点低阈值压缩;如果轻声部分被抬得太高、出现了明显的噪声,说明要先回到降噪步骤。压缩器不是调一次就完事,整个过程要按照“听感”来微调。
在 Audacity 中,可使用“效果”→“压缩器”,同样设置阈值约 -20 dB,压缩比 3.5:1,攻击时间 0.01 秒,释放时间 0.15 秒。Audacity 的压缩器默认会把低于阈值的信号也做增益补偿,这里需要注意勾选“基于峰值进行归一化”或调节“噪音平台”,避免把底噪抬太多。
4.4 第三步:多频段压缩(可选,但很解决问题)
如果只是偶尔某几个字偏大,宽带压缩就够了。但很多时候问题体现在不同频段:
- 低频“轰”或“喷”导致低频频段忽大忽小;
- 中频人声不够突出;
- 高频“齿音”偶尔刺耳。
这时候多频段压缩器更有优势。它把声音分成几段频率分别处理,避免压缩整个人声时把中低频细节破坏掉。
通用的频段分段参考:
| 频段 | 推荐处理内容 |
|---|---|
| 低频(< 150 Hz) | 减少喷麦、低频轰鸣、房间共鸣 |
| 中低频(150 - 500 Hz) | 控制声音“盒子感”与厚度变化 |
| 中频(500 - 4 kHz) | 保持语音清晰度,尽量少压 |
| 高频(> 4 kHz) | 控制齿音和气息过强 |
在 Audition 中可使用“效果”→“振幅与压限”→“多频段压缩器”。你可以先载入“人声音乐”预设,再根据频段表微调。不要所有频段都用相同的阈值,否则会丢失语音的自然度。
4.5 第四步:限制器兜底
压缩做完后,再加一个限制器。在 Audition 中可用“效果”→“振幅与压限”→“强制限制”:
| 参数 | 建议值 |
|---|---|
| 最大振幅 | -3.0 dB(或平台要求值) |
| 输入提升 | 0 dB |
| 启动时间 | 5 ms |
| 释放时间 | 100 ms |
在 Audacity 中,可安装并加载“Limiter”插件,将 Limit to(dB)设为 -3.0,或者使用“效果”→“限制器”调整。这里的重点不是限制得多狠,而是保证输出不会超出 -3 dBFS。最后标准化可以再做一次目标响度匹配。
4.6 第五步:响度匹配与目标标准化
响度匹配建议分成两步:
- 段落响度匹配(如果有多句起伏过大)
- 全片目标标准化
在 Audition 中,可以使用“匹配响度”面板:
- 在“文件面板”中选中所有需要处理的音频文件。
- 点击窗口菜单里的“匹配响度”。
- 在“响度”选项卡里设置目标响度,例如 -16 LUFS。
- 可以同时设置“允许的最大真峰值”为 -3 dBTP。
- 点击“运行”。
Audition 会按照 EBU R128 标准计算每段素材的响度,并将它们调整为目标值。这是目前最标准的自动化响度处理方式之一。
在 Audacity 中,可以安装 Loudness Normalization 插件,或使用自带的“归一化”功能,但要注意:普通“归一化”只是按照峰值进行增益,不等于按 LUFS 标准化。如果有更高要求,建议使用独立响度插件,例如 Youlean Loudness Meter 配合手动增益。
4.7 第六步:试听与波形复核
处理完不要直接导出,建议按下面的清单检查:
- 波形图是否还有明显的“细段”和“宽段”差异?
- 响度直方图是否集中在一个较窄的范围?
- 最容易出现忽大忽小的句子是否已经平稳?
- 是否有压缩后产生的“翁翁”噪声?
- 是否出现了字头被压缩掉导致“口齿不清”的现象?
如果都通过,再导出 WAV 或平台要求的格式。
5. 不同工具的配置示例
这一节单独罗列几种常见场景下的工具参数,方便有基础的读者快速查询。
5.1 Adobe Audition 宽频压缩器参考
路径:“效果”→“振幅与压限”→“动态处理”。
| 参数 | 参考值 | 说明 |
|---|---|---|
| 阈值 | -24 dB ~ -18 dB | 根据素材最大峰值调整 |
| 压缩比 | 2.5:1 ~ 4:1 | 不要超过 6:1,避免语音失去自然动态 |
| Attack | 5 ms ~ 15 ms | 保留字头清晰度 |
| Release | 80 ms ~ 200 ms | 值太小容易喘,值太大语音浑浊 |
| 输出增益 | +2 dB ~ +6 dB | 依靠电平表观察平均水平,不必固定 |
5.2 Audacity 压缩器参考
路径:“效果”→“压缩器”。
- 阈值:-20 dB
- 噪声门限:如果底噪明显可设置在 -50 dB 以下,起到轻微降噪作用。
- 压缩比:3:1
- Attack Time:0.01 秒
- Release Time:0.15 秒
Audacity 中“压缩器”的参数叫作“Compression Ratio”,即压缩比。如果勾选了“根据峰值使音量最大化”,它会在压缩后执行峰值最大化,这个选项适合响度偏低但动态已经稳定的素材。
5.3 iZotope RX Dynamics 模块参考
如果你使用 RX,优先试听并用一下 “Dynamics” 模块:
- 模式选择 Compressor。
- Threshold:-20 dBFS。
- Ratio:3:1。
- Attack:15 ms。
- Release:150 ms。
- 还可以打开 “Lookahead”,设置为 5 ms,避免瞬时峰值打穿。
RX 的优势是可以配合 “De-click”“De-plosive” 等模块先做修复,再做动态处理,链路过长时也更稳定。
5.4 批处理思路
当素材不是一段 5 分钟的音频,而是 50 个章节文件时,你不可能逐个人工压缩。建议思路如下:
- 先选出 2 到 3 个最有代表性的样本文件,做一次完整动态处理。
- 记录这组参数,保存为预设。
- 在 Audition 的“批处理”或“匹配响度”面板中应用该预设。
- 批处理完成后,仍然要随机抽查 10% 的文件,注意有没有句子过载,有没有段落被压缩得听不清。
批处理的目的是提高效率,不是代替听感检查。有声书和播客这类以语音为主的内容,最终交付前必须有人耳复核。
6. 常见问题与排查思路
| 问题现象 | 常见原因 | 解决思路 |
|---|---|---|
| 压缩后声音变闷,字头不清晰 | Attack 太短或压缩比过大 | 提高 Attack 到 10 ms 以上,降低压缩比到 3:1 以下 |
| 背景噪声被放大 | 压缩前未有效降噪,或压缩器阈值太低 | 先做降噪处理;把压缩阈值提高一点,让轻噪声不要触发压缩 |
| 整段音频出现“呼吸泵”感 | Release 时间太短,或压缩比设置较高但启停频繁 | 增大 Release 到 150~300 ms |
| 峰值虽然不高但仍感觉“爆” | 瞬时峰值由多个频段叠加,宽带限制器处理不过来 | 使用多频段压缩或真峰值限制器,并降低最大输出电平 |
| 响度匹配后句子依然忽大忽小 | 只做了整体标准化,没有做段落响度匹配 | 将音频按句或按段落切分,分段动态处理后再整体标准化 |
| 压缩后音量虽然稳定,但没有感情 | 动态范围被过度压缩 | 把压缩比降到 2:1,保留语气起伏;压缩主要针对最大峰值 |
| 字与字之间的“气声”显得太突出 | 压缩把小信号也抬上来了 | 使用噪声门或低阈值压缩时多听小声段效果,不要全局拉增益 |
排查时建议不要一项一项盲目改参数,而是先还原到“原始备份”,再依次启用:降噪 → 修复 → 压缩 → 限制器 → 标准化,每步都做 AB 对比试听。只有这样才能定位是哪个环节引入了新问题。
7. 工程建议:从源头减少音量忽大忽小
后期处理能解决的问题有一定上限。如果录音环节的麦克风距离忽近忽远、增益设置始终不对,后期再怎么压也会有痕迹。这里给几条从源头控制动态范围的建议,能明显减少后期工作量:
- 控制嘴与麦克风的距离。建议在 15 到 20 厘米左右保持稳定,不要忽近忽远。如果习惯性激动,可以在桌面贴一条胶带标记距离范围。
- 录音增益不要过低,也不要过高。通常建议平均电平在 -18 dBFS 到 -12 dBFS 之间,峰值预留至少 6 dB 的余量。过低的电平在后期放大时会放大底噪。
- 把录音环境噪声压低。关掉空调、风扇、显示器散热噪声。如果背景噪声很大,动态处理的余地很小。
- 情绪爆发段落适当拉远麦克风。人声的“炸”往往是因为音量增大时口腔喷出气流,距离远了以后,音量变化会缓和,但麦克风格依旧能捕捉到情绪。
- 分段录制。有声书或播客如果时间较长,可以分成多段录。每段之间休息几秒,后期更容易定位问题。
- 录音时不要做大幅自动增益。有些声卡或软件默认开启自动增益,它会让录音的电平在安静时自动变大、响亮时自动变小,反而给后期留出更差的动态。如果条件允许,尽量用固定增益模式录制。
以上内容本质上是把“后期修补”转化为“前期录音设计”。很多只做后期处理的人会发现,每次遇到动态范围极大的干音,处理完总有人说“声音不自然”;如果你能提醒或引导录音者改善收音方式,成品质量会有质的提高。
8. 如果你做的是直播或视频口播,注意这一点
视频剪辑场景中,音量忽大忽小和有声书后期略有不同。视频通常还伴随背景音乐、同期声、环境声。在做音频处理时,不要把人声轨单独压完后就丢进剪辑软件,还需要检查背景音乐与人声的比例。
推荐的做法是:
- 人声轨:压缩 + 限制,目标响度控制在 -16 LUFS 左右;
- 背景音乐轨:宁可低 3 到 6 dB,压低到 -23 LUFS 左右;
- 最后通过视频剪辑软件的音量自动符合或响度匹配功能,整体输出为平台目标响度。
如果你想快速判断视频音频的动态,可以在剪辑软件里查看响度表,例如 Pr 的“响度计”或达芬奇的 Loudness Meter,确认“短期响度”和“真峰值”都符合平台要求。
9. 处理顺序、实践验证与下一步规划
最后再强调一次本文的核心顺序:
- 备份。
- 修复(降噪、去爆音、去口水声)。
- 宽带压缩:缩小整体动态范围。
- 多频段压缩(可选):处理频段性忽大忽小。
- 限制器:防止瞬时峰值越过天花板。
- 段落响度匹配与整体标准化:确保听感统一。
- 用耳朵和响度表双重复核后导出。
这套顺序适用于大多数有声书、播客、视频口播、在线课程音频。如果你的音频是音乐类内容,处理逻辑会不同,不建议直接套用。
下一步你可以做几个小实验来加深印象:
- 找到三到五段问题音频文件,先不做任何处理,分别统计它们的峰值、平均响度和动态范围。
- 只压缩不标准化,听效果;只标准化不压缩,听效果。对比后,你会更能理解为什么需要多级处理。
- 制作一个“处理前后”的 AB 文件,用响度表对比,找出自己偏好的听感范围。
处理这类问题的核心不是某个工具按钮,而是你如何在“保留自然语音动态”和“消除忽大忽小听感”之间找到平衡点。建议你在每次处理结束后,都把参数和听感记录下来,形成自己的预设库,这样长期做后期会越来越快,也越来越稳定。