5.2.2 时域与频域特征(Time/Frequency Domain Features)

完成切帧与加窗后,每一帧都是一个短时平稳的信号片段。接下来的问题是:对每一帧,我们要看什么?

答案取决于分析的目的。如果关心响度变化,就看能量;关心清浊与噪声,就看过零率;关心音色明暗,就看频谱的重心;关心音高与旋律,就看基频与色度。这些 "看什么" 的量化指标,统称为 音频特征(Audio Features)。本节按照 时域 → 频域 → 感知域 的递进顺序,建立音频帧分析最常用的特征体系。

时域特征(Time Domain Features)

时域特征直接由帧内采样值计算,无需变换,成本最低。

短时能量(STE [Short-Time Energy]),第 $m$ 帧的能量总和:

Em=n=0N1xm2[n]E_m = \sum_{n=0}^{N-1} x_m^2[n]

工程中更常用其归一化开方形式 均方根(RMS [Root Mean Square])

RMSm=1Nn=0N1xm2[n]RMS_m = \sqrt{\frac{1}{N} \sum_{n=0}^{N-1} x_m^2[n]}

RMS 与我们在 1.2 节 讨论的响度感知直接相关,是 响度随时间变化 的最常用量化曲线。静音检测、音量包络、动态范围分析都建立在它之上。

过零率(ZCR [Zero-Crossing Rate]),帧内信号穿过零轴的频次:

Zm=12Nn=1N1sgn(xm[n])sgn(xm[n1])Z_m = \frac{1}{2N} \sum_{n=1}^{N-1} \left| \mathrm{sgn}(x_m[n]) - \mathrm{sgn}(x_m[n-1]) \right|

过零率是信号 "噪声程度" 的粗略探针:浊音(如元音、乐音)周期性强、过零率低且稳定;清音与噪声(如摩擦音、打击乐瞬态)过零率高而杂乱。它也常被用作 基频的粗估计——对于纯净的单音,每秒过零次数约等于基频的两倍。

频域特征(Frequency Domain Features)

对加窗后的帧做 DFT 得到频谱 $X_m[k]$ 后,便可以提取频域特征。

频谱质心(Spectral Centroid),频谱能量在频率轴上的 "重心":

Cm=kfkXm[k]kXm[k]C_m = \frac{\sum_k f_k \, |X_m[k]|}{\sum_k |X_m[k]|}

质心越高,声音听感越 "明亮";越低则越 "沉闷"。它与 1.3.3 节 讨论的音色感知密切相关,是区分乐器材质的常用指标。

围绕频谱形状,还有一组衍生特征:频谱带宽(Spectral Bandwidth) 描述能量围绕质心的分散程度;频谱滚降点(Spectral Rolloff) 指累计能量达到总能量固定比例(常取 85% 或 95%)的频率位置,可用于区分谐波信号与噪声信号。

感知域特征(Perceptual Features)

时域与频域特征都是 物理量。但人耳对频率的感知并非线性——这正是 1.4.3 节 等响曲线所揭示的事实。面向听觉感知的特征,需要先把频率轴映射到感知刻度。

梅尔刻度(Mel Scale) 是最常用的感知频率刻度,其物理频率 $f$ 到梅尔值 $m$ 的转换为:

m=2595log10(1+f700)m = 2595 \log_{10} \left( 1 + \frac{f}{700} \right)

在梅尔刻度上,等间隔的 Mel 值对应人耳等间隔的音高感知。基于它构建的 梅尔滤波器组(Mel Filter Bank),在低频段密集、高频段稀疏,恰与人耳的分辨能力分布一致。

梅尔频率倒谱系数(MFCC [Mel Frequency Cepstral Coefficients]) [12] 的计算管线为:

  1. 帧频谱经梅尔滤波器组加权,得到各梅尔频带的能量
  2. 对滤波器组能量取对数(压缩动态范围,近似人耳的响度感知)
  3. 对对数能量谱做 离散余弦变换(DCT,见 3.5.1,取前 12~13 个系数

MFCC 将频谱包络压缩为少量去相关的系数,是语音识别与音频分类任务数十年的 事实标准输入特征

色度特征(Chroma Features) 则完全面向乐理。它将频谱能量按 音级(Pitch Class) 折叠到 12 个半音桶中——无论 A3、A4 还是 A5,其能量都归入 "A" 这一维。于是色度向量直接回答了 "当前时刻响起的是哪个音名",与 1.4.1 节 的音调与五度圈体系天然衔接,是和弦识别、旋律分析的入口特征。

基频与节拍(Pitch & Tempo)

最后是两个 时间结构化 的高层特征。

基频(F0 [Fundamental Frequency]) 即音高的物理对应(见 1.3.1)。5.2.1 已经说明:受限于 $\Delta f = f_s / N$,单帧 FFT 峰值无法精确给出基频。工程上采用专门的 基频跟踪(Pitch Tracking) 算法,如 YIN 族算法及其概率化改进 pYIN [13] ——通过在多帧间寻找周期性候选并做连续决策,将估计精度提升到亚频点级别。

节拍(Beat)与速度(Tempo) 则描述音乐的脉冲结构。常用做法是先提取 起音包络(Onset Envelope)——能量突增的时刻序列,再在其自相关上做动态规划搜索最优周期,即经典的 动态规划节拍跟踪(Beat Tracking by Dynamic Programming) [14]

至此,音频帧的特征体系已经建立:时域看能量,频域看形状,感知域看听觉,高层看音高与节奏。这些特征不是孤立的清单,而是一条从物理信号到听觉语义的完整提取链。

理论储备就绪,是时候动手了。下一节,我们将用这套体系分析一段真实的标准音素材。

Copyright © Since 2021 李述博 (Arikan.Li) , All Rights Reserved all right reserved,powered by GitbookLast Updated: 2026-08-25 08:20:30

results matching ""

    No results matching ""