【问题标题】:How to build a language model from the phonetic transcription?如何从音标构建语言模型?
【发布时间】:2015-09-18 04:25:31
【问题描述】:

我使用来自维基百科转储的数据,使用工具 CMUCLMTK 为泰米尔语构建了一个语言模型。现在,我如何生成语音转录并在模型中替换它们。维基文章 (http://cmusphinx.sourceforge.net/wiki/phonemerecognition) 说要替换转录而不是文字。我现在应该做什么?

【问题讨论】:

    标签: speech-recognition cmusphinx pocketsphinx language-model


    【解决方案1】:

    您可以编写一个 python 脚本来用它的音素替换一个字符。英语中大约有 44 个音素,您可以简单地创建一个字典,将一个字符映射到它的音素。并且要将您的转录转换为音素,只需将每个单词分解为字符并通过匹配字典中的字符替换为它的音素。您可以通过使用词频或 tf-idf 使这更有趣

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-02-26
      • 1970-01-01
      • 1970-01-01
      • 2021-10-06
      • 1970-01-01
      • 2018-01-13
      相关资源
      最近更新 更多