5.2.2 时域与频域特征(Time/Frequency Domain Features)
完成切帧与加窗后,每一帧都是一个短时平稳的信号片段。接下来的问题是:对每一帧,我们要看什么?
答案取决于分析的目的。如果关心响度变化,就看能量;关心清浊与噪声,就看过零率;关心音色明暗,就看频谱的重心;关心音高与旋律,就看基频与色度。这些 "看什么" 的量化指标,统称为 音频特征(Audio Features)。本节按照 时域 → 频域 → 感知域 的递进顺序,建立音频帧分析最常用的特征体系。
时域特征(Time Domain Features)
时域特征直接由帧内采样值计算,无需变换,成本最低。
短时能量(STE [Short-Time Energy]),第 $m$ 帧的能量总和:
工程中更常用其归一化开方形式 均方根(RMS [Root Mean Square]):
RMS 与我们在 1.2 节 讨论的响度感知直接相关,是 响度随时间变化 的最常用量化曲线。静音检测、音量包络、动态范围分析都建立在它之上。
过零率(ZCR [Zero-Crossing Rate]),帧内信号穿过零轴的频次:
过零率是信号 "噪声程度" 的粗略探针:浊音(如元音、乐音)周期性强、过零率低且稳定;清音与噪声(如摩擦音、打击乐瞬态)过零率高而杂乱。它也常被用作 基频的粗估计——对于纯净的单音,每秒过零次数约等于基频的两倍。
频域特征(Frequency Domain Features)
对加窗后的帧做 DFT 得到频谱 $X_m[k]$ 后,便可以提取频域特征。
频谱质心(Spectral Centroid),频谱能量在频率轴上的 "重心":
质心越高,声音听感越 "明亮";越低则越 "沉闷"。它与 1.3.3 节 讨论的音色感知密切相关,是区分乐器材质的常用指标。
围绕频谱形状,还有一组衍生特征:频谱带宽(Spectral Bandwidth) 描述能量围绕质心的分散程度;频谱滚降点(Spectral Rolloff) 指累计能量达到总能量固定比例(常取 85% 或 95%)的频率位置,可用于区分谐波信号与噪声信号。
感知域特征(Perceptual Features)
时域与频域特征都是 物理量。但人耳对频率的感知并非线性——这正是 1.4.3 节 等响曲线所揭示的事实。面向听觉感知的特征,需要先把频率轴映射到感知刻度。
梅尔刻度(Mel Scale) 是最常用的感知频率刻度,其物理频率 $f$ 到梅尔值 $m$ 的转换为:
在梅尔刻度上,等间隔的 Mel 值对应人耳等间隔的音高感知。基于它构建的 梅尔滤波器组(Mel Filter Bank),在低频段密集、高频段稀疏,恰与人耳的分辨能力分布一致。
梅尔频率倒谱系数(MFCC [Mel Frequency Cepstral Coefficients]) [12] 的计算管线为:
- 帧频谱经梅尔滤波器组加权,得到各梅尔频带的能量
- 对滤波器组能量取对数(压缩动态范围,近似人耳的响度感知)
- 对对数能量谱做 离散余弦变换(DCT,见 3.5.1),取前 12~13 个系数
MFCC 将频谱包络压缩为少量去相关的系数,是语音识别与音频分类任务数十年的 事实标准输入特征。
色度特征(Chroma Features) 则完全面向乐理。它将频谱能量按 音级(Pitch Class) 折叠到 12 个半音桶中——无论 A3、A4 还是 A5,其能量都归入 "A" 这一维。于是色度向量直接回答了 "当前时刻响起的是哪个音名",与 1.4.1 节 的音调与五度圈体系天然衔接,是和弦识别、旋律分析的入口特征。
基频与节拍(Pitch & Tempo)
最后是两个 时间结构化 的高层特征。
基频(F0 [Fundamental Frequency]) 即音高的物理对应(见 1.3.1)。5.2.1 已经说明:受限于 $\Delta f = f_s / N$,单帧 FFT 峰值无法精确给出基频。工程上采用专门的 基频跟踪(Pitch Tracking) 算法,如 YIN 族算法及其概率化改进 pYIN [13] ——通过在多帧间寻找周期性候选并做连续决策,将估计精度提升到亚频点级别。
节拍(Beat)与速度(Tempo) 则描述音乐的脉冲结构。常用做法是先提取 起音包络(Onset Envelope)——能量突增的时刻序列,再在其自相关上做动态规划搜索最优周期,即经典的 动态规划节拍跟踪(Beat Tracking by Dynamic Programming) [14] 。
至此,音频帧的特征体系已经建立:时域看能量,频域看形状,感知域看听觉,高层看音高与节奏。这些特征不是孤立的清单,而是一条从物理信号到听觉语义的完整提取链。
理论储备就绪,是时候动手了。下一节,我们将用这套体系分析一段真实的标准音素材。