音频与音乐的深度学习应用
在音频和音乐处理领域,深度学习正发挥着越来越重要的作用。本文将深入探讨音频处理中的多种特征表示方法、不同的深度学习模型以及它们在音乐内容描述中的具体应用。
1. 音频特征表示
1.1 MFCC与Log - Mel - Spectrogram
MFCC(Mel频率倒谱系数)计算中,DCT(离散余弦变换)用于使MFCC的各个维度去相关。这是因为在语音声学模型中,常使用具有对角协方差矩阵的高斯混合分布来表示这些特征。而在DNN(深度神经网络)中,输入的去相关不是必需的,因此Log - Mel - Spectrogram(LMS)被广泛采用,它形成了一个时间与梅尔带频率的矩阵表示。
1.2 离散傅里叶变换(DFT)与小波分析
DFT的时间和频率分辨率在时间和频率上保持恒定。为了克服这一限制,小波分析应运而生,它在低频处提供更精细的频谱分辨率,在高频处提供更精细的时间分辨率。Constant - Q - Transform(CQT)是一种适用于音乐信号的小波分析形式,它遵循对数频率尺度,在音高上具有一定的平移不变性。
1.3 频谱图图像与自然图像的区别
| 图像类型 | 坐标轴含义 | 元素意义 | 相邻像素相关性 | CNN适用性 |
|---|---|---|---|---|
| 自然图像 | x和y轴都表示空间位置 | 元素意义与位 |
超级会员免费看
订阅专栏 解锁全文

691

被折叠的 条评论
为什么被折叠?



