【发布时间】:2019-12-03 02:02:56
【问题描述】:
我想使用 python 在浮点表示中量化声音的深度。例如,低沉的声音可以用低于 0 的分数来表示,而高亢的声音(与深沉相反)用高于 0 的分数来表示。深沉的声音可以与阿诺德施瓦辛格的声音进行比较,而高声则与小孩子的声音。
我没有从谷歌搜索中找到任何明确的方法来解决这个问题。我尝试使用timbral model 来获得音色分数,但似乎计算没有用。也就是说,深沉的声音和高声音的分数并没有太大的差别。
基于这个source,我可以使用FFT分析。但是,我不明白如何将 FFT 图简化为声音深度的单一表示。
那么在使用 FFT 获得分析后,我该如何进行呢?在一个更广泛的问题中,我如何专门使用 Python 将声音的深度表示为浮点表示?
编辑:有关额外信息,我要量化的数据集由歌声组成。我已经获得了 FFT 输出并通过平均操作减少了时间帧维度,所以我得到了针对频率仓的平均结果。
由于数据集具有显着的音高特征,当两个声音在唱同一个音符时,低沉和高声的矢量峰值相似。我的推断是,这是由于两种声音产生了相同的谐波。 (请随时纠正我的解释。)
有什么有效的方法来区分唱同一个音符的低声和高声?
【问题讨论】: