【问题标题】:Very low accuracy while using open ears for speech recognition使用张开耳朵进行语音识别时的准确性非常低
【发布时间】:2016-07-01 04:06:52
【问题描述】:

我在我的应用中使用张开耳朵进行语音识别。主要关注的是准确性。在安静的环境中,准确率约为 50%,但在嘈杂的环境中情况会变得更糟。几乎没有任何东西被正确识别。我目前正在使用大约 300 个单词的字典文件。我应该寻找哪些区域来提高准确性?到目前为止,我还没有对此进行任何调整。

【问题讨论】:

    标签: ios speech-recognition openears


    【解决方案1】:

    语音识别应用程序的设计要求您了解语音识别背后的一些基本概念,例如声学模型、语法和语音词典。您可以从 CMUSphinx 教程中了解更多信息http://cmusphinx.sourceforge.net/wiki/tutorial

    准确度差是语音应用程序开发的正常状态,您可以使用一个过程来改进它并使应用程序有用。流程如下:

    1. 收集您尝试识别的语音样本并创建语音数据库以测量当前准确度并了解其背后的问题

    2. 尝试使用词汇量大小来提高不同之间的分离度 语音提示。例如,10 个命令的词汇比 300 个命令的词汇更容易识别。

    3. 设计您的应用程序,使要识别的变体数量更少,并且 人们的回答是直截了当的。这项活动称为 VUI(语音用户界面设计),这是一个相当大的领域,有许多精彩的书籍和博客文章。你可以在这里找到一些细节:http://www.amazon.com/Voice-Interface-Design-Michael-Cohen/dp/0321185765

    4. 尝试改进应用程序的声学部分。修改字典以匹配您的演讲。调整声学模型以匹配声学特性。声学模型适配过程说明见http://cmusphinx.sourceforge.net/wiki/tutorialadapt

    【讨论】:

    • 感谢您的回答。我对您提到的 4 点进行了一些研究。但是有一些事情我需要澄清
      1. 使用词汇量大小不是一个选项我,因为该应用程序需要理解大量可编辑的单词列表。
      2.我承认我还没有研究过 vui 设计。准确性问题变得至关重要。在这种情况下,你会建议我投入到那个领域?研究 VUI 需要多少时间?
    • 好的。我的主要目的是识别用户在(嘈杂的)教室环境中戳过的单词。用户可以将更多他选择的单词添加到字典中。现在的问题只是准确性。此外,由于我和用户位于世界不同地区,口音问题是一个主要问题。我也怀疑我是否能够从真实用户那里获得音频样本。
    • 嗯,当然有问题,但可以解决。重音问题通过适应来解决。房间混响问题通过强大的功能得到解决。噪声通常通过声学前端的噪声消除来过滤。如果您打算为此工作,那一切都是可行的。
    • 嗯.....好吧,还有一件事,我浏览了 CMU 页面以进行声学模型适配,但如果必须识别多个用户的声音,我发现缺少这些步骤
    • 哦,这是我们正在谈论的 ipad 应用程序(如果有什么不同的话:))
    猜你喜欢
    • 2011-10-06
    • 1970-01-01
    • 1970-01-01
    • 2013-07-17
    • 2012-07-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-07-01
    相关资源
    最近更新 更多