【问题标题】:Search for a particular spoken word in audio files [closed]在音频文件中搜索特定的口语单词[关闭]
【发布时间】:2019-09-05 17:02:35
【问题描述】:

我有大约 3000 多个同一作者的音频文件。我需要转录那些讲座,作者在其中谈到了一个特定的词。

所以我需要一个软件解决方案,它会自动找到说出特定单词的所有文件。由于音频文件的使用时间超过 15 年,因此该词的发音方式可能会有所不同。

欢迎免费/开源解决方案。

我尝试搜索,了解了狮身人面像。但我无法将其设置为用于我的项目。任何帮助是极大的赞赏。请

【问题讨论】:

  • 嘿,你能做到这一点吗?如果是,请分享如何? github repo 会很棒!
  • 我和 DJ_Stuffy_K 在一起。我也对您的解决方案感兴趣。

标签: speech-recognition


【解决方案1】:

您可以使用CMUSphinx,这是一个支持关键字定位的开源语音识别引擎。

1) 将音频转换为所需格式 - 16khz 16bit 单声道文件:

 ffmpeg -i file.mp3 -ar 16000 -ac 1 file.wav

2) 从http://github.com/cmusphinx 构建和安装最新的 pocketsphinx 和 sphinxbase

3) 下载en-us generic acoustic model

4) 运行检测:

  pocketsphinx_continuous -infile file.wav -hmm en-us -kws_threshold 1e-40 -keyphrase "what you need to detect" -time yes

它将打印您检测到的关键字及其时间。为了获得最佳检测精度,您可以调整 kws_threshold。

【讨论】:

  • 感谢尼古拉的回答。由于这个声学模型是通用的,如何根据扬声器已经录制的音频文件制作声学模型?
  • 对于关键字发现,您不需要依赖说话者的模型,它不会显着改善事情。如果你仍然想适应它,有一个声学模型适应教程cmusphinx.sourceforge.net/wiki/tutorialadapt
  • 如果我要搜索的关键字不在标准英语词典中,那么关键字定位是否仍然有效?
  • 还有一个问题,说话人由于瘫痪不能像以前一样正常说话,因此说话人不能说出声学模型的训练文本。有什么方法可以通过使用已经转录的音频文件来训练模型?谢谢
  • 是的,您可以使用已经转录的音频文件进行模型适配。模型适配没有什么不同,而不是使用现有的录制新音频。你只需要在句子上删减它。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2023-03-07
  • 1970-01-01
  • 2022-12-06
  • 2021-03-17
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多