【问题标题】:Is there any speech recognition API besides Google that returns interim results?除了 Google 之外,还有没有返回中间结果的语音识别 API?
【发布时间】:2015-12-28 18:57:50
【问题描述】:
我正在寻找一种语音识别 API,它可以在用户说话时返回中间结果,类似于 Google 在其主页上所做的 (https://www.google.com)。我正在寻找支持法语的 API。我想做的是创建一个类似于 Google 语音搜索的 Web 应用程序。
【问题讨论】:
标签:
speech-recognition
speech-to-text
cmusphinx
ibm-watson
google-speech-api
【解决方案1】:
许多语音转文本应用程序都使用 Nuance Communications 开发的语音识别技术。可以很好地与 Web 应用程序配合使用的 SDK 是他们的 Server SDK,它支持将流式音频转换为文本。除了英语和德语,它还支持法语。要使用它,您可能需要通过 AJAX 请求将音频输入流式传输到将要处理它的服务器,然后从您的 AJAX 请求中接受文本作为 XMLHTTPResponse。
【解决方案2】:
Cortana 和 Skype 翻译使用的 Microsoft 的 Project Oxford Speech Recognition API 满足您的两个条件:它支持法语(和其他 6 种语言)并在您向其传输音频时返回部分/临时/在线假设。
(顺便说一句,在使用 Pocketsphinx 进行在线识别时,导致准确性极差的常见问题是糟糕的 CMN(倒谱均值归一化)。当您给 pocketsphinx 一个完整的音频片段进行处理时,它会计算整个话语的 CMN,但是当您将音频流式传输到它时,默认情况下它不会计算 CMN。一种解决方案是给它一个完整的话语,检索由 pocketsphinx 计算的 CMN,然后将该 CMN 用于流式音频。请注意,每个音频的 CMN 都不同通道/环境,并且到 pocketsphinx 的 Python 接口不提供与 CMN 数据的接口。如果你想研究这条路线,我有一个补丁。)