视频动画技术

背景音乐添加与音量平衡:BGM 20-40%、人声优先的黄金比例

👤 为我痴狂 👁 2 阅读 ❤ 0 点赞 ➦ 0 分享 📅 2026-10-01
首页› 视频动画› 视频动画技术› 正文
背景音乐添加与音量平衡:BGM 20-40%、人声优先的黄金比例

从等响曲线、听觉掩蔽到 LUFS 标准化——一套可复现的人声优先混音方法论

摘要

背景音乐(BGM)与人声的响度关系,是播客、短视频、直播、游戏语音等内容形态中最容易被忽视、却最直接影响完播率与信息传达效率的技术变量。本文以“人声优先”为核心原则,系统梳理等响曲线、听觉掩蔽、LUFS 响度标准化等基础理论,提出 BGM 相对人声控制在 20%–40% 的工程区间,并给出分场景的增益标定、侧链压缩、动态均衡与自动化实现路径。

全文贯穿一条独创性分析主线:响度平衡的本质不是“把音乐调小”,而是在人声可懂度约束下对频谱掩蔽与动态余量的联合优化。围绕这条主线,文章从理论、测量、操作到前沿预判逐层展开,力求为内容创作者与音频工程师提供可落地、可验证的技术参考。

一、问题的起点:为什么“BGM 20-40%”值得被当作一个工程命题

在视频剪辑软件里,背景音乐轨道的音量滑块通常以百分比或分贝两种方式呈现。很多教程会给出一个笼统的建议:把 BGM 调到 20%–40%,人声保持在 0 dB 附近。这个数字看起来像是经验之谈,但它背后其实对应着一组可以被测量、被推导、被复现的声学约束。把它当作工程命题而非“手感问题”,是本文的出发点。

先说清楚一个前提:音量滑块上的“20%”并不是声压级的 20%,也不是功率的 20%。在多数非线性映射的推子上,20% 的位置可能对应 −14 dB 到 −20 dB 不等的实际增益衰减,具体取决于软件厂商的推子曲线设计。因此,讨论“20%–40%”时必须先把它翻译成分贝,否则跨软件、跨平台的沟通会完全失效。本文后续统一采用 dBFS(相对满刻度的分贝)作为计量单位,百分比仅作为界面操作的近似指代。

那么,为什么人声与 BGM 之间需要一个相对固定的比例关系?核心原因在于人类听觉系统对语音信号的解码具有“脆性”。语音的可懂度依赖于辅音的能量爆发、元音的共振峰结构以及音节之间的时间包络,这些特征在频谱上分布不均,且对掩蔽极为敏感。当背景音乐在中频段(约 500 Hz–4 kHz)堆积过多能量时,语音的辅音信息会率先被“盖住”,听者主观上会觉得“人声发闷、听不清词”,即便整体响度并没有明显下降。

本文评述:把 BGM 比例问题归结为“审美偏好”是一种常见的偷懒。事实上,只要内容的目标是“让人听清说话”,就存在一个由听觉生理决定的客观下限和上限。20%–40% 之所以反复出现在各类实践中,正是因为它大致落在这个客观区间内。但它不是万能常数,而是需要根据人声类型、音乐频谱、播放环境和目标平台动态调整的基准值。

1.1 一个被低估的成本:听不清带来的注意力损耗

从信息传播的角度看,人声与 BGM 的失衡会直接抬高听众的“认知负荷”。当语音可懂度下降时,大脑需要调用额外的注意力资源去补全缺失的音节,这种补偿过程会挤占用于理解内容语义的工作记忆。结果就是:听众不是“觉得吵”,而是“听着累”,进而在几十秒内流失。

这一点在移动端场景中尤为明显。手机外放扬声器的低频响应普遍较弱,中高频相对突出,这会让某些在监听耳机上听起来平衡的混音,在手机上变得人声更“尖”或音乐更“吵”。因此,任何关于 BGM 比例的讨论,都必须把“目标播放设备”作为一个显式变量纳入进来,而不是假设存在一个放之四海皆准的数值。

1.2 本文的分析主线

为了让后续章节不流于零散技巧的堆砌,这里先明确贯穿全文的主线:响度平衡的本质,是在人声可懂度约束下,对频谱掩蔽与动态余量的联合优化。这条主线包含三个可操作的子问题:第一,人声在哪些频段最需要被保护;第二,BGM 在这些频段需要衰减多少;第三,如何在不牺牲音乐完整性的前提下实现这种衰减。后续每一章都会回到这三个子问题上。

二、理论地基:等响曲线、掩蔽效应与可懂度

要理解 BGM 比例,必须先理解人耳如何“分配注意力”。这一节梳理三个基础概念:等响曲线、听觉掩蔽和语音可懂度。它们共同构成了 20%–40% 区间的理论依据。

2.1 等响曲线:为什么低频可以“多给一点”

等响曲线(Equal-loudness contour)描述了在相同主观响度下,不同频率所需的声压级差异。经典的 ISO 226 标准给出了这一关系的标准化描述,其最新修订版本整合了多国实验室的听音数据。曲线的核心特征是:人耳对 2 kHz–5 kHz 附近最敏感,对低频(100 Hz 以下)和高频(10 kHz 以上)则明显迟钝。

这一特性对混音有直接含义:在相同的主观响度下,低频需要更高的声压级才能被感知。因此,BGM 中的低频成分(如底鼓、贝斯)即使能量较高,也不容易与人声的中频信息产生直接冲突;真正危险的是 1 kHz–4 kHz 这个“人声核心区”,人耳在这里最敏感,掩蔽也最容易发生。

本文评述:很多创作者凭直觉把 BGM 整体压低,结果音乐变得“没有存在感”,而人声依然不够清晰。更有效的做法是分频段处理——在低频保留甚至略微提升音乐的能量,在中频对人声核心区做针对性衰减。这正是后文动态均衡与多段压缩的理论依据。

2.2 听觉掩蔽:同时掩蔽与时间掩蔽

听觉掩蔽(Auditory masking)是指一个声音(掩蔽声)导致另一个声音(被掩蔽声)的听阈升高的现象。它分为两类:同时掩蔽(频域掩蔽)和时间掩蔽(时域掩蔽)。

同时掩蔽的规律是:掩蔽声在频率上越接近被掩蔽声,掩蔽效果越强;掩蔽声的声压级越高,掩蔽范围越宽。对于语音而言,BGM 中与人声基频(男声约 85–180 Hz,女声约 165–255 Hz)及共振峰(主要在 500 Hz–3 kHz)重叠的成分,是最主要的掩蔽源。

时间掩蔽则涉及前后向掩蔽:掩蔽声结束后的一小段时间内(约 50–200 ms),被掩蔽声的听阈仍会升高,称为后向掩蔽;掩蔽声出现前的一小段时间(约 20 ms)也存在前向掩蔽。这意味着,如果 BGM 在音节间隙出现瞬态能量(如鼓点、镲片),会“污染”紧随其后的辅音,导致听感上“字咬不清”。

笔者认为,时间掩蔽是许多创作者忽视的维度。它解释了为什么有些 BGM 整体音量并不高,却依然让人觉得“人声被压住”——问题出在瞬态的时间对齐上,而非稳态响度。解决思路包括:选择瞬态较弱的音乐、对 BGM 做瞬态整形(transient shaping)、或利用侧链压缩让 BGM 在人声出现时快速让路。

2.3 语音可懂度:STI 与 SII 的启示

语音可懂度有成熟的客观测量体系。语音传输指数(Speech Transmission Index, STI)通过调制传递函数评估传输通道对语音包络的保真程度,取值 0–1,通常 0.6 以上被认为可懂度良好。语音可懂度指数(Speech Intelligibility Index, SII)则基于频带重要性函数,计算各频带信噪比贡献的加权和。

这些指标原本用于建筑声学和通信系统,但其核心思想对内容混音同样适用:语音可懂度不是由整体信噪比决定的,而是由各频带信噪比的加权组合决定的。换句话说,把 BGM 整体降低 6 dB,和只在人声关键频段降低 6 dB,对可懂度的提升效果可能相近,但对音乐听感的破坏程度却大不相同。

概念 核心含义 对 BGM 平衡的启示
等响曲线 不同频率达到相同主观响度所需的声压级不同 低频可多留,中频需谨慎
同时掩蔽 频域接近的声音相互掩盖 避开人声共振峰频段
时间掩蔽 掩蔽声前后一段时间内听阈升高 控制 BGM 瞬态,避免污染辅音
STI / SII 基于频带加权的可懂度指标 分频段优化优于整体压低

三、响度标准化:LUFS、真峰值与动态范围

如果说第二节回答的是“为什么”,这一节回答的是“用什么量”。在数字音频工作流中,LUFS 已经成为跨平台响度标准化的通用语言。理解它,是把“20%–40%”从模糊手感转化为可复现参数的前提。

3.1 LUFS 与 ITU-R BS.1770

LUFS(Loudness Units Full Scale)源自 ITU-R BS.1770 建议书及其后续修订,其计算过程包括 K 频率加权、声道加权和门限门控。K 加权模拟人耳对中频的敏感度,门控机制则排除静音段对平均值的拉低。相比传统的 RMS 或峰值表,LUFS 更接近人耳对“整体响度”的主观感受。

主流平台已给出明确的响度目标:YouTube 通常将内容标准化到约 −14 LUFS,Spotify 约 −14 LUFS,Apple Podcasts 建议约 −16 LUFS(立体声),广播领域 EBU R128 规定 −23 LUFS,ATSC A/85 规定 −24 LKFS。这些数值是平台播放时的目标,而非创作时的强制值,但了解它们有助于预判上传后的响度变化。

本文评述:平台标准化是一把双刃剑。如果创作者把人声推到 −10 LUFS 而 BGM 相对很低,上传后平台可能整体压低,导致动态被压缩、听感变“扁”。更稳妥的策略是:在混音阶段就把整体响度控制在目标平台附近,并保留足够的动态余量,而不是依赖平台的事后处理。

3.2 真峰值与削波风险

真峰值(True Peak)考虑了数模转换过程中的采样间峰值,单位 dBTP。ITU-R BS.1770 建议真峰值不超过 −1 dBTP,以避免在编码和播放环节产生削波。对于人声与 BGM 叠加的内容,这一点尤其重要:两轨叠加后峰值可能比单轨高出 3–6 dB,如果前期没有预留余量,很容易在副歌或情绪高点出现失真。

操作建议:在总线上保留 −6 dB 左右的余量进行混音,最终输出前再用限幅器把真峰值控制在 −1 dBTP 以内。这样既保护了瞬态,也避免了平台转码时的意外削波。

3.3 动态范围:被比例数字掩盖的变量

同样是人声与 BGM 相差 12 dB,动态范围宽的人声(如轻声细语到高声强调)和动态范围窄的人声(如持续平稳的旁白),对 BGM 的要求完全不同。前者需要 BGM 在轻声段更“让路”,后者则可以保持相对稳定的 BGM 电平。

因此,一个负责任的混音流程应该先测量人声的动态范围(可用短时 LUFS 的最大值与最小值之差近似),再决定 BGM 是采用固定增益还是动态跟随。这也是后文侧链压缩与自动化包络的用武之地。

四、20%–40% 区间的来源与边界条件

现在回到核心数字。20%–40% 这个区间并非凭空而来,它可以从三个角度交叉验证:主观听音实验的普遍结论、广播与播客行业的实践惯例、以及可懂度指标的推算。

4.1 从主观听音到工程惯例

在广播和播客制作中,人声与背景音乐的电平差通常落在 10–20 dB 之间。若以人声平均响度为 0 dB 参考,BGM 大致在 −10 dB 到 −20 dB。换算成线性比例,−10 dB 约等于 32%,−20 dB 约等于 10%。这与“20%–40%”的区间大致吻合,但更精确的表述应该是“BGM 比人声低 10–18 dB”。

需要强调的是,这里的“低 10–18 dB”指的是平均响度差,而非峰值差。音乐的高潮段峰值可能远高于平均值,如果只看峰值,会误判 BGM 的实际掩蔽程度。因此,测量时应使用 LUFS 或 RMS 平均值,而非峰值表。

4.2 边界条件:什么时候需要突破区间

20%–40% 是基准,不是教条。以下情况需要主动偏离:

  • 音乐是内容主体时:如音乐赏析、舞蹈教学,BGM 可能需要提升到与人声接近甚至更高的水平,此时人声反而成为“解说层”。
  • 人声为耳语或 ASMR 时:人声能量低、频谱特殊,BGM 需要压得更低,甚至低于 10%。
  • 环境嘈杂的播放场景:如车载、健身房,低频环境噪声会掩蔽人声低频,此时可适当提升人声的中高频而非整体降低 BGM。
  • 音乐频谱与人声高度重叠时:如钢琴独奏、弦乐长音,即使 BGM 电平不高,也可能造成明显掩蔽,需要额外做频谱避让。

本文评述:把 20%–40% 理解为“默认值”而非“正确答案”,是专业与业余的分水岭。专业流程会先测量、再判断、后调整,而不是套用一个固定数字。区间的作用是缩小搜索范围,而不是替代判断。

4.3 一个可操作的标定流程

下面给出一个从零开始的标定流程,适用于大多数“人声为主、音乐为辅”的内容:

  1. 将人声轨道的平均响度标定到目标平台附近(如 −16 LUFS)。
  2. 将 BGM 轨道初始设置为比人声低 15 dB。
  3. 播放一段包含人声与 BGM 的典型片段,用监听耳机和手机外放各听一遍。
  4. 若人声清晰但音乐“消失”,将 BGM 提高 2–3 dB;若人声发闷,将 BGM 降低 2–3 dB。
  5. 重复第 3–4 步,直到在两种设备上都能听清人声且音乐有存在感。
  6. 记录最终的 LUFS 差值,作为后续同类内容的起点。

五、分场景增益标定:播客、短视频、直播、游戏

不同内容形态对“人声优先”的要求并不相同。这一节按场景给出更具体的参数建议。需要说明的是,以下数值是基于行业实践与公开技术文档的整合建议,属于工程参考值,实际使用时应结合具体素材试听调整。

5.1 播客与有声书

播客以长时间语音为主,听众往往在通勤、运动等场景收听,环境噪声不可控。因此,人声可懂度的优先级最高。建议人声平均响度 −16 LUFS 左右,BGM 比人声低 15–20 dB,且在片头片尾等无人声段落可适当提升 BGM 以增强氛围。

有声书对可懂度的要求更高,BGM 通常只在章节切换处出现,正文部分建议完全静音或极低电平。若必须保留持续 BGM,建议低于人声 20 dB 以上,并选择频谱稀疏、无强烈节奏的音乐。

5.2 短视频与 Vlog

短视频的观看环境多为手机外放,且用户注意力切换快。BGM 在这里承担情绪引导和节奏支撑的双重角色,因此可以比播客更突出。建议人声 −14 LUFS 左右,BGM 比人声低 10–15 dB,在无人声的转场或空镜段落可提升到 −8 dB 左右。

短视频平台通常会对上传音频做响度标准化,因此过度压缩动态反而会让内容在信息流中显得平淡。保留一定的动态起伏,有助于在自动播放时抓住注意力。

5.3 直播

直播的音频链路更长,涉及采集、混音、编码、传输和播放,任何一环的增益设置不当都会累积。建议在 OBS 等软件中为人声设置独立的压缩器和限幅器,BGM 通过侧链压缩跟随人声。BGM 基础电平比人声低 12–18 dB,侧链压缩的阈值设在人声平均电平以下 3–6 dB,压缩比 2:1 到 4:1,启动时间 5–10 ms,释放时间 100–300 ms。

直播中还需注意音乐版权与平台检测。使用平台曲库或已授权音乐,可以避免直播中断或回放静音。

5.4 游戏语音与解说

游戏场景的音频层次最复杂:语音、音效、环境声、BGM 同时存在。此时“人声优先”不仅关乎 BGM,还涉及音效的动态管理。通用做法是:语音通道保持最高优先级,BGM 和部分音效通过侧链或闪避(ducking)在语音出现时衰减。BGM 基础电平可比语音低 15–20 dB,音效则根据信息重要性分级处理。

场景 人声目标响度 BGM 相对人声 关键处理
播客 / 有声书 −16 LUFS −15 至 −20 dB 中频避让、动态均衡
短视频 / Vlog −14 LUFS −10 至 −15 dB 段落自动化、瞬态整形
直播 −14 至 −16 LUFS −12 至 −18 dB 侧链压缩、限幅保护
游戏语音 按引擎混音总线设定 −15 至 −20 dB 优先级闪避、总线压缩

六、工程操作路径:从侧链压缩到动态均衡

理论说清楚之后,这一节给出具体的工程操作路径。核心思路是:不要只靠推子,而是用动态处理工具让 BGM 在人声出现时“主动让路”。

6.1 侧链压缩:最直接的让路方案

侧链压缩(Sidechain Compression)的原理是:用一条轨道的信号触发另一条轨道的压缩器。在这里,用人声触发 BGM 的压缩器,当人声出现时 BGM 自动衰减,人声停止后 BGM 恢复。

参数建议:阈值设为人声平均电平以下 3–6 dB,压缩比 2:1 到 4:1,启动时间 5–10 ms(太快会损失音乐瞬态,太慢会漏掉辅音),释放时间 100–300 ms(太快会“抽吸”,太慢会让人声结束后音乐恢复迟缓)。侧链压缩的优点是自动化程度高,缺点是可能让音乐听起来“忽大忽小”,因此需要配合适度的释放时间和增益补偿。

本文评述:侧链压缩不是万能药。对于节奏感强的音乐,频繁的增益起伏会破坏律动;对于古典或氛围音乐,则可能产生不自然的“呼吸感”。更精细的做法是结合动态均衡,只在人声关键频段做衰减,保留音乐其他频段的完整性。

6.2 动态均衡:频域上的精准避让

动态均衡(Dynamic EQ)可以理解为“分频段的侧链压缩”。它只在特定频段、特定条件下进行衰减,对人声核心区(约 1–4 kHz)做动态衰减,而对低频和高频保持不动。

典型设置:在 BGM 轨道上插入动态均衡,选择一个宽频段(Q 值 0.7–1.5),中心频率 2–3 kHz,增益衰减 3–6 dB,触发阈值与人声电平联动。这样,当人声出现时,BGM 的中频自动下沉,人声的辅音和共振峰得以凸显;人声停止后,BGM 恢复原有频谱平衡。

6.3 多段压缩与瞬态整形

对于频谱复杂的 BGM,多段压缩可以更精细地控制各频段的动态。例如,将 BGM 分为低频、中频、高频三段,中频段做较强的压缩和衰减,低频段保持稳定,高频段适度衰减以减少齿音冲突。

瞬态整形(Transient Shaper)则用于削弱 BGM 中过强的鼓点或拨弦瞬态,减少时间掩蔽。操作上可以降低 attack 增益、保留 sustain,让音乐的“骨架”还在,但“尖刺”被磨平。

6.4 一个完整的处理链示例

人声轨:
  → 高通滤波(80 Hz)
  → 压缩器(阈值 −18 dB,比 3:1,启动 10 ms,释放 80 ms)
  → 去齿音(5–8 kHz,衰减 3–4 dB)
  → 均衡(提升 2–5 kHz 清晰度 2–3 dB)
  → 限幅(真峰值 −1 dBTP)

BGM 轨:
  → 动态均衡(2–3 kHz,衰减 4–6 dB,侧链触发)
  → 多段压缩(中频段 2:1,启动 15 ms,释放 200 ms)
  → 瞬态整形(attack 降低 30%)
  → 增益(比人声低 12–18 dB)

总线:
  → 总线压缩(比 2:1,轻微)
  → 限幅(真峰值 −1 dBTP)
  → 输出目标响度(−14 至 −16 LUFS)

七、自动化与批处理:把经验变成可复现的流程

对于需要批量处理的内容(如系列课程、日更播客),手动调整每一期的 BGM 电平既不现实也不一致。这一节讨论如何用工具把上述流程自动化。

7.1 基于 FFmpeg 的响度标准化

FFmpeg 提供了 loudnorm 滤波器,可以测量并标准化音频响度。基本用法是先测量、再应用,避免单遍处理的动态失真。以下命令用于测量输入文件的响度参数:

ffmpeg -i input.wav -af loudnorm=I=-16:TP=-1.5:LRA=11:print_format=json -f null -

得到测量值后,再用双遍模式应用标准化,可以在保持动态的同时达到目标响度。对于人声与 BGM 已混好的文件,loudnorm 能保证整体响度一致,但无法解决频谱掩蔽问题——那需要在混音阶段处理。

7.2 用脚本实现人声检测与 BGM 闪避

如果不想在 DAW 中手动做侧链,可以用脚本实现简化版闪避。思路是:用人声轨道的包络或能量检测生成增益曲线,再应用到 BGM 轨道。Python 的 librosa、pydub 等库可以完成这类任务,但需要注意时间对齐和增益平滑,避免产生“抽吸”感。

对于非编程用户,Audacity 的“自动闪避”功能、Reaper 的侧链路由、Adobe Audition 的“语音自动闪避”都是可用的替代方案。选择工具时,优先考虑是否支持可调参数和预览,而不是追求全自动。

7.3 模板化:一次设置,长期复用

最高效的自动化其实是模板化。在 DAW 中建立包含人声链、BGM 链、总线链的工程模板,每次新建项目时直接调用,只需替换素材和微调增益。模板中应包含:预设的压缩器、均衡器、动态均衡、限幅器,以及标注好的目标 LUFS 和 BGM 相对电平。

本文评述:模板化的价值不仅在于省时间,更在于保证一致性。对于品牌化内容,稳定的听感本身就是质量的一部分。把“20%–40%”写进模板,比每次凭感觉调整更可靠。

八、常见误区与听感校准

即使掌握了参数,实际制作中仍有一些高频误区。这一节列出最常见的几个,并给出校准方法。

8.1 只看推子百分比,不看实际响度

不同软件的推子曲线不同,20% 在不同软件中可能对应完全不同的增益。正确做法是用响度表(LUFS 表)测量实际输出,而不是依赖推子位置。免费工具如 Youlean Loudness Meter、dpMeter 都可以实时显示 LUFS 和真峰值。

8.2 只在一种设备上试听

监听耳机、手机外放、笔记本扬声器的频率响应差异巨大。只在耳机上平衡的混音,在手机上可能人声刺耳或音乐消失。建议至少在三类设备上试听:监听耳机、手机外放、普通蓝牙音箱。如果条件允许,再增加车载音响。

8.3 忽视音乐本身的频谱特性

同样电平下,钢琴独奏和弦乐合奏的掩蔽效果完全不同。选择 BGM 时,应优先考虑频谱稀疏、中频留白较多的曲目。如果必须使用中频密集的音乐,就需要更激进的动态均衡或更低的整体电平。

8.4 响度战争思维

部分创作者习惯把所有内容推到尽可能响,认为“响就是好”。但在平台标准化的今天,过度压缩动态只会让内容在自动播放时显得疲惫。保留动态、尊重人声的自然起伏,反而更有利于长时间收听。

听感校准小技巧:把混音导出后,用手机在安静房间外放,音量调到平时刷视频的水平。如果第一遍就能听清每一个字,且音乐不显得突兀,这个平衡大概率是合格的。如果需要“努力听”,说明人声还需要更多保护。

九、前沿预判:AI 分离、个性化响度与空间音频

技术不会停在推子和压缩器上。这一节讨论三个可能改变 BGM 平衡工作流的方向。

9.1 AI 音源分离与智能闪避

基于深度学习的音源分离(如 Demucs、Spleeter 及其后续模型)已经可以把混音拆成人声、鼓、贝斯、其他等 stems。这意味着,即使手头只有一版混好的音乐,也可以提取出人声或节奏轨,用于更精准的侧链触发。未来,DAW 可能内置“智能闪避”功能:自动识别人声频段和瞬态,实时生成最优的 BGM 增益曲线。

本文评述:AI 分离的精度仍在提升,但当前用于触发侧链已经足够。真正的瓶颈不在分离算法,而在于“什么是最优增益曲线”这一主观判断。工具可以自动化执行,但目标函数仍需人来定义。

9.2 个性化响度与听力补偿

不同用户的听力状况、播放设备、环境噪声差异巨大。未来的播放平台可能根据用户听力曲线和环境噪声,实时调整人声与 BGM 的比例。例如,在嘈杂环境中自动提升人声频段,在安静环境中保留更多音乐细节。这需要内容在制作时保留足够的分离度,而不是把两轨“焊死”。

9.3 空间音频中的新维度

在杜比全景声等空间音频格式中,人声和 BGM 可以被放置在同一个声场的不同位置。人声居中、BGM 环绕,可以在不降低 BGM 电平的情况下减少掩蔽——因为空间分离本身就能提升听觉流的分组效率。这为“人声优先”提供了新的实现路径:不是让音乐变小,而是让音乐“退到后面”。

笔者认为,空间音频的普及会逐渐改变“20%–40%”这一比例的表达方式。未来更准确的描述可能是“人声位于前方中心,BGM 位于环绕层,两者在频谱上适度避让”。但在此之前,立体声混音仍将是主流,本文给出的方法仍然适用。

十、结论与操作清单

回到最初的问题:BGM 20%–40%、人声优先,到底意味着什么?经过前面的分析,可以给出一个更精确的表述:在典型的人声为主内容中,BGM 的平均响度应比人声低 10–18 dB,并通过动态均衡和侧链压缩在人声关键频段进一步避让。百分比只是界面上的近似,dB 才是可复现的工程语言。

最后给出一份可执行的操作清单,供实际制作时对照:

  1. 确定目标平台和播放设备,查清其响度标准。
  2. 先处理人声:高通、压缩、去齿音、清晰度均衡、限幅。
  3. 测量人声平均 LUFS,作为 BGM 的参考基准。
  4. BGM 初始设为比人声低 15 dB,再根据试听微调。
  5. 插入动态均衡,在 1–4 kHz 对人声关键区做 3–6 dB 动态衰减。
  6. 如需更强避让,加入侧链压缩,阈值、启动、释放按本文建议设置。
  7. 对 BGM 做瞬态整形,削弱鼓点对辅音的时间掩蔽。
  8. 在耳机、手机、音箱上分别试听,确认人声清晰且音乐不突兀。
  9. 总线限幅到 −1 dBTP,输出响度对齐平台目标。
  10. 记录本次参数,沉淀为模板,供后续同类内容复用。

音频平衡既是科学也是手艺。科学提供了区间和工具,手艺决定了在区间内如何取舍。希望本文提供的主线——在人声可懂度约束下对频谱掩蔽与动态余量做联合优化——能帮助读者在面对具体素材时,做出有依据、可复现的判断,而不是停留在“感觉这样比较好”的层面。

参考文献(主要)

[1] ITU-R. Recommendation BS.1770: Algorithms to measure audio programme loudness and true-peak audio level. International Telecommunication Union, 2023.

[2] ITU-R. Recommendation BS.1387: Method for objective measurements of perceived audio quality. International Telecommunication Union, 2023.

[3] ISO. ISO 226:2023 Acoustics — Normal equal-loudness-level contours. International Organization for Standardization, 2023.

[4] EBU. EBU R 128: Loudness normalisation and permitted maximum level of audio signals. European Broadcasting Union, 2023.

[5] ATSC. ATSC A/85: Techniques for establishing and maintaining audio loudness for digital television. Advanced Television Systems Committee, 2024.

[6] Zwicker E, Fastl H. Psychoacoustics: Facts and Models. Springer, 2022.

[7] Moore B C J. An Introduction to the Psychology of Hearing. Brill, 2023.

[8] 中国国家广播电视总局. 广播电视节目响度技术规范. 2023.

[9] 全国广播电影电视标准化技术委员会. 数字音频响度测量方法. 2024.

扩展学习资源:

FFmpeg loudnorm 官方文档:https://ffmpeg.org/ffmpeg-filters.html#loudnorm

Youlean Loudness Meter 免费版:https://youlean.co/youlean-loudness-meter/

Audacity 自动闪避教程:https://manual.audacityteam.org/man/auto_duck.html

Reaper 侧链压缩视频教程:https://www.reaper.fm/videos.php

文章声明:本文内容仅为作者学习、思考、经验、笔记的总结,仅供技术交流与参考。文中观点仅代表笔者个人思辨,不构成任何学术建议、商业建议或专业建议。所有数据来源已标注,引用时请以原始文献为准。

内容仅供学习参考。如需引用,请以原始文献为准。  |  全文约 12600 字  |  参考文献 68 篇(主要 9 篇)

分享到

💬
微信
📷
朋友圈
🐧
QQ好友
🌐
QQ空间
👁
微博
📌
钉钉
🔗
复制链接
📑
复制图文

微信扫一扫分享

打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。

💬 评论 (0)

评论功能已关闭

⏸️ 本站暂未开放评论功能,不能进行评论,此为规划的后续开发预留
首页| 关于本网| 网站声明| 联系我们| 网站纠错| 服务| 网站地图
黔ICP备19010680号-1  |  邮箱:six528528@163.com
贵公网安备 52010302001819号
Copyright 2019-2026 http://www.databrush.com/ All rights reserved.
QQ
QQ扫一扫
Logo
DBN数据刷