5.2 音频帧分析实践(Audio Frame Analysis in Practice)
在 5.1 中,我们已经完成了分析环境的准备,并对音频分析库的基本用法做了简单介绍。有了这些工具,接下来就可以真正对 音频帧(Audio Frame) 进行分析实践了。
回顾 5.1 对音频帧的定义:音频帧是 一段音频中一个有效数据块,是音频信号在 时间轴上的离散片段。我们也曾提到,对音频的分析更多是从 音频整体角度,或 范围内的局部情况 进行。那么,如何界定这个 "局部"?又如何从每个局部中,提取出 有工程意义的信息?这是本节要回答的两个问题。
这要从音频信号的一个关键性质说起:宏观上非平稳,微观上短时平稳。一段音乐在数秒内的频谱可能千变万化,但在 20~40 毫秒 的尺度上,却可以近似认为是不变的。几乎所有音频分析技术,都建立在这一性质之上。因此,我们才能把一段连续的音频,切分为一系列短时稳定的片段,再对每个片段独立地进行频谱与特征分析。
因此,本节将沿着 "如何切分 → 切分后看什么 → 动手做一遍" 的路线递进展开:
- 5.2.1 音频帧的切分与加窗:讨论短时平稳假设的工程依据,帧长与帧移的取舍,以及加窗对频谱泄漏的抑制
- 5.2.2 时域与频域特征:建立音频帧的特征体系,从时域能量到频域质心,再到面向人耳感知的 MFCC 与色度特征
- 5.2.3 实战:A4 标准音的特征分析工程:以第一章的 A440 标准音素材为对象,搭建一条完整的音频帧分析流水线,并对实测结果进行解读
完成本节后,我们将具备对任意音频进行 帧级特征提取 的能力。这套能力不仅是音频分析的核心,也是后续 语音识别、音乐信息检索、音频质量监控 等高级应用的共同起点。