【发布时间】:2017-02-10 08:41:25
【问题描述】:
我正在考虑使用 Google Cloud Speech 来转换长格式的旁白音频文件,我需要知道音频文件中每个短语的开始时间。有没有办法用谷歌云语音做到这一点?
我目前正在使用transcribe_async.py。
谢谢。
【问题讨论】:
标签: audio speech-to-text google-speech-api google-cloud-speech
我正在考虑使用 Google Cloud Speech 来转换长格式的旁白音频文件,我需要知道音频文件中每个短语的开始时间。有没有办法用谷歌云语音做到这一点?
我目前正在使用transcribe_async.py。
谢谢。
【问题讨论】:
标签: audio speech-to-text google-speech-api google-cloud-speech
这在 Google Cloud Speech 中是不可能的。如果该信息对您很重要,您可能需要查看其他 ASR 系统。我知道像Kaldi 和CMU Sphinx 这样的离线、非托管ASR 系统会为您提供这些信息。我不知道是否或哪些托管 ASR 系统可以提供该信息。
【讨论】:
您可以通过将 enableWordTimeOffsets 选项设置为 True 来获取每个单词的(近似的)开始和结束时间(从音轨的开头):https://cloud.google.com/speech/docs/async-time-offsets。
请注意,成绩单第一个单词的开始时间始终为 0,而且据我所知,每个单词的开始时间都对应于前一个单词的结束时间(如果有停顿也是如此)。
【讨论】: