【问题标题】:Getting the frequencies associated with STFT in Librosa在 Librosa 中获取与 STFT 相关的频率
【发布时间】:2020-08-11 02:01:12
【问题描述】:

当使用librosa.stft() 计算频谱图时,如何取回相关的频率值?我对生成 librosa.display.specshow 中的图像不感兴趣,但我希望掌握这些值。

y, sr = librosa.load('../recordings/high_pitch.m4a')
stft = librosa.stft(y, n_fft=256, window=sig.windows.hamming)
spec = np.abs(stft)

spec 给我每个频率的“幅度”或“功率”,但不是频率箱本身。我已经看到有一个display.specshow 函数将在热图的垂直轴上显示这些频率值,但不返回值本身。

我正在为单个 FFT 寻找类似于 nn.fft.fttfreq() 的内容,但在 librosa 文档中找不到它的等价物。

【问题讨论】:

    标签: python signal-processing fft librosa dft


    【解决方案1】:

    我想特别指出这个问题和答案:How do I obtain the frequencies of each value in an FFT?。除了咨询documentation for the STFT from librosa,我们知道横轴是时间轴,纵轴是频率。频谱图中的每一列都是时间切片的 FFT,此时的中心有一个放置有n_fft=256 分量的窗口。

    我们还知道有一个跳数,它告诉我们在计算下一个 FFT 之前需要跳过多少音频样本。默认情况下为n_fft / 4,因此音频中每256 / 4 = 64 个点,我们计算一个新的FFT,以n_fft=256 点长为中心。如果您想知道每个窗口居中的确切时间点,那就是i / Fsi 是音频信号的索引,是 64 的倍数。

    现在,对于每个 FFT 窗口,对于实信号,频谱是对称的,因此我们只考虑 FFT 的正侧。这已通过文档验证,其中行数以及频率分量的数量为1 + n_fft / 2,其中 1 是直流分量。既然我们现在有了这个,参考上面的帖子从bin编号到对应频率的关系是i * Fs / n_ffti是bin编号,Fs是采样频率,n_fft=256是点数FFT 窗口。由于我们只查看半光谱,而不是从 0 到 n_ffti,而是从 0 到 1 + n_fft / 2,因为超出 1 + n_fft / 2 的箱将只是半光谱的反射版本所以我们不考虑Fs / 2Hz以外的频率分量。

    如果你想生成一个包含这些频率的 NumPy 数组,你可以这样做:

    import numpy as np
    freqs = np.arange(0, 1 + n_fft / 2) * Fs / n_fft
    

    freqs 是一个将 FFT 中的 bin 编号映射到相应频率的数组。作为一个说明性示例,假设我们的采样频率为 16384 Hz,n_fft = 256。因此:

    In [1]: import numpy as np
    
    In [2]: Fs = 16384
    
    In [3]: n_fft = 256
    
    In [4]: np.arange(0, 1 + n_fft / 2) * Fs / n_fft
    Out[4]:
    array([   0.,   64.,  128.,  192.,  256.,  320.,  384.,  448.,  512.,
            576.,  640.,  704.,  768.,  832.,  896.,  960., 1024., 1088.,
           1152., 1216., 1280., 1344., 1408., 1472., 1536., 1600., 1664.,
           1728., 1792., 1856., 1920., 1984., 2048., 2112., 2176., 2240.,
           2304., 2368., 2432., 2496., 2560., 2624., 2688., 2752., 2816.,
           2880., 2944., 3008., 3072., 3136., 3200., 3264., 3328., 3392.,
           3456., 3520., 3584., 3648., 3712., 3776., 3840., 3904., 3968.,
           4032., 4096., 4160., 4224., 4288., 4352., 4416., 4480., 4544.,
           4608., 4672., 4736., 4800., 4864., 4928., 4992., 5056., 5120.,
           5184., 5248., 5312., 5376., 5440., 5504., 5568., 5632., 5696.,
           5760., 5824., 5888., 5952., 6016., 6080., 6144., 6208., 6272.,
           6336., 6400., 6464., 6528., 6592., 6656., 6720., 6784., 6848.,
           6912., 6976., 7040., 7104., 7168., 7232., 7296., 7360., 7424.,
           7488., 7552., 7616., 7680., 7744., 7808., 7872., 7936., 8000.,
           8064., 8128., 8192.])
    
    In [5]: freqs = _; len(freqs)
    Out[5]: 129
    

    我们可以看到我们已经生成了一个1 + n_fft / 2 = 129 元素数组,它告诉我们每个对应的 bin 编号的频率。


    注意事项

    请注意,librosa.display.specshow 的默认采样率为 22050 Hz,因此如果您不将采样率 (sr) 设置为与音频信号相同的采样频率,则垂直轴和水平轴将不会是正确的。确保指定 sr 输入标志以匹配传入音频的采样频率。

    【讨论】:

    • 谢谢雷!很好的答案!
    • 很好的解释! PS 默认 n_fft 在 librosa 0.8 中是 2048
    • 我不明白,我只得到一个向量,我希望从频谱图中的每个样本中获取一个向量???,因为当你绘制频谱图时,你可以看到你有多个频率在每个时间点??如果有人可以向我解释一下,那就太好了:(
    • @Darome 请发布一个新问题,解释您面临的问题和错误。但是,如果我正确理解你的问题,这个问题特别描述了频谱图中每个时间点的相关频率区间。如果您在此答案中使用上述代码,它只会生成这些垃圾箱。如果您想要实际的频谱图,您需要运行librosa.stft,如上面的问题所示。
    【解决方案2】:

    除了rayryengexcellent explanation 之外,应该注意的是,librosa 中numpy.fft.fftfreq() 的直接等价物是librosa.fft_frequencies()

    你可以按如下方式使用它:

    y, sr = librosa.load('../recordings/high_pitch.m4a')
    Nfft = 256
    stft = librosa.stft(y, n_fft=Nfft, window=sig.windows.hamming)
    freqs = librosa.fft_frequencies(sr=sr, n_fft=Nfft)
    

    【讨论】:

    • 你知道的越多。谢谢!
    • 谢谢,很方便。
    • 我不明白,我只得到一个向量,我希望从频谱图中的每个样本中获取一个向量???,因为当你绘制频谱图时,你可以看到你有多个频率在每个时间点??如果有人能给我解释一下,那就太好了:(
    • @Darome 您似乎有一个特定的问题,可能需要一个特定的 SO 问题,包括 MVCE,这将使我们能够重现您的问题并提供适当的解释。
    【解决方案3】:

    您可以按如下方式计算累积能量

    samplerate = 48000
    Nfft = 8192
    freqs = librosa.fft_frequencies(sr=sr, n_fft=Nfft)
    plt.loglog(freqs, np.mean(mag**2, axis=1)/(Nfft/2)**2)
    plt.xlabel('freq [Hz]')
    

    如果你想对一个频率范围内的能量求和,你可以在频率上使用 index mag,例如

    np.sum(np.mean(mag[(freqs > 1000) & (freqs < 1480), :]**2, axis=1))/(Nfft/2)**2
    

    更一般地你可以应用一个过滤器gain(f),上面的结果是用一个矩形得到的gain(f)

    np.sum(np.mean(mag**2, axis=1)*gain(freq))/(Nfft/2)**2
    
    

    免责声明:我不知道这些比例因子是否适合您。只有形状。

    【讨论】:

      猜你喜欢
      • 2020-07-25
      • 1970-01-01
      • 2017-10-08
      • 1970-01-01
      • 1970-01-01
      • 2011-04-11
      • 2017-08-06
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多