【问题标题】:How to decode speech input如何解码语音输入
【发布时间】:2014-03-05 01:20:41
【问题描述】:

我想做的是创建一个 API,将人类语音转换为 IPA(国际音标)格式。我的问题是,如何在原始音频波形级别解码语音的资源在哪里。我寻找了一个 API,但我发现的大部分内容都直接翻译成罗马字母。我正在寻找能够更准确地区分人声语音的东西。

【问题讨论】:

    标签: audio machine-learning speech-recognition voice-recognition


    【解决方案1】:

    首先我想说的是,这个项目比您想象的要困难和复杂得多。语音到文本处理是一个非常庞大且复杂的领域,已经进行了大量的研究。大多数解析器将内容直接发送到罗马字符的原因是因为它们的大部分处理是模糊声音与其他模糊声音的上下文的概率匹配,以猜测哪些单词一起有意义。您更有可能找到可以为您提供 Soundex 而不是 IPA 的东西。也就是说,这是一个在多个方面都已解决的问题。您最好的选择可能是 CMU 的 Sphinx 项目。

    http://cmusphinx.sourceforge.net/wiki/start
    

    这将为您提供一个良好的开端,但您假设语音到文本的处理比实际要发达得多,并且没有简单的方法可以通过波形将语音转换为 IPA,并且具有任何精度. Sphinx 是非常模块化且完全开源的,因此它可以为您提供触手可及的巨大功能,此时您是否能够弄清楚如何使这项工作取决于您,但又一次。无论如何,这不是一个已解决的问题。

    【讨论】:

    • 听起来是一件值得做的事情。有没有人记录了当前用于语音 文本的方法的已知信息?
    • 这几乎都在 cmu sphinx 下,他们有相当广泛的实验和修改日志,因此您不仅可以看到当前实现的最新和最伟大的内容,还可以看到他们的实验尝试寻找具有最佳性能的特征。 sourceforge.net/projects/cmusphinx/forums/forum/5470
    • 非常漂亮。我很期待这个项目。谢谢!
    猜你喜欢
    • 1970-01-01
    • 2012-11-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2022-08-02
    • 1970-01-01
    相关资源
    最近更新 更多