【发布时间】:2018-05-10 19:14:48
【问题描述】:
我有一个包含视频流的数据库。我想从图像和 MFCC 音频中计算 LBP 特征,并且对于视频中的每一帧我都有一些注释。注释内嵌视频帧和视频时间。因此,我想将我从注释中获得的时间映射到 mfcc 的结果。我知道 sample_rate = 44100
from python_speech_features import mfcc
from python_speech_features import logfbank
import scipy.io.wavfile as wav
audio_file = "sample.wav"
(rate,sig) = wav.read(audio_file)
mfcc_feat = mfcc(sig,rate)
print len(sig) # 2130912
print len(mfcc_feat) # 4831
首先,为什么 mfcc 长度的结果是 4831 以及如何在我以秒为单位的注释中映射它?视频总时长为 48 秒。并且除了 19-29 秒的窗口之外,视频的注释在任何地方都是 0。我如何从 mfcc 的结果中找到窗口 (19-29) 内的样本?
【问题讨论】:
-
只是评论:Librosa 有多种特征提取方法。它可能对您的工作有所帮助。 github.com/librosa/librosa/blob/master/examples/…
标签: python python-2.7 signals mfcc