【问题标题】:Is there any speech recognition API besides Google that returns interim results?除了 Google 之外,还有没有返回中间结果的语音识别 API?
【发布时间】:2015-12-28 18:57:50
【问题描述】:

我正在寻找一种语音识别 API,它可以在用户说话时返回中间结果,类似于 Google 在其主页上所做的 (https://www.google.com)。我正在寻找支持法语的 API。我想做的是创建一个类似于 Google 语音搜索的 Web 应用程序。

  • 不建议将 Google Speech API 用于专业开发,因为它经常更改并且没有完整的文档记录。
  • IBM Watson 不支持法语
  • AT&T Speech API 不返回中间结果
  • CMU Sphinx 返回非常糟糕的结果(在此处查看演示:http://syl22-00.github.io/pocketsphinx.js/live-demo.html
  • Nuance 产品似乎不是为 Web 应用程序设计的。 (如果你知道我应该如何使用它们,我很感兴趣!)

【问题讨论】:

    标签: speech-recognition speech-to-text cmusphinx ibm-watson google-speech-api


    【解决方案1】:

    许多语音转文本应用程序都使用 Nuance Communications 开发的语音识别技术。可以很好地与 Web 应用程序配合使用的 SDK 是他们的 Server SDK,它支持将流式音频转换为文本。除了英语和德语,它还支持法语。要使用它,您可能需要通过 AJAX 请求将音频输入流式传输到将要处理它的服务器,然后从您的 AJAX 请求中接受文本作为 XMLHTTPResponse。

    【讨论】:

      【解决方案2】:

      Cortana 和 Skype 翻译使用的 Microsoft 的 Project Oxford Speech Recognition API 满足您的两个条件:它支持法语(和其他 6 种语言)并在您向其传输音频时返回部分/临时/在线假设。

      (顺便说一句,在使用 Pocketsphinx 进行在线识别时,导致准确性极差的常见问题是糟糕的 CMN(倒谱均值归一化)。当您给 pocketsphinx 一个完整的音频片段进行处理时,它会计算整个话语的 CMN,但是当您将音频流式传输到它时,默认情况下它不会计算 CMN。一种解决方案是给它一个完整的话语,检索由 pocketsphinx 计算的 CMN,然后将该 CMN 用于流式音频。请注意,每个音频的 CMN 都不同通道/环境,并且到 pocketsphinx 的 Python 接口不提供与 CMN 数据的接口。如果你想研究这条路线,我有一个补丁。)

      【讨论】:

        猜你喜欢
        • 2016-04-14
        • 2023-03-24
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2011-12-19
        • 1970-01-01
        相关资源
        最近更新 更多