【问题标题】:Google Speech API Single Utterance谷歌语音 API 单一话语
【发布时间】:2018-09-12 09:54:19
【问题描述】:

Google Speech API 的SingleUtterance 是如何工作的?根据文档,这是谷歌确定说话者何时说出单一话语的方式。我明白它的作用,但我想知道怎么做? API 是否只是等待一段时间的“无声”音频?如果是这样,多长时间无声音频会触发话语的结束?

它是否有其他类型的 AI 算法来帮助确定某人何时停止说话?

谢谢

【问题讨论】:

  • 我建议在此处删除 C# 标记 - 您碰巧使用哪种语言与 Speech API 对话并不重要,并且该标记可能会让其他期望该问题的用户反感特定于 C#。

标签: google-cloud-platform google-speech-api transcription


【解决方案1】:

我认为不会暴露细节,我认为检测音频结尾是 API 的决定。相反,它提供了识别何时做出此类决定的方法。

在正常情况下,流将继续收听和处理音频,直到the stream is closed directly, or the stream's limit length has been exceeded。在这种情况下,不需要设置 single_utterance。

当您需要它(例如语音命令)并设置 single_utterance=true 时,API 会决定何时完成识别并向您的客户端发送 END_OF_SINGLE_UTTERANCE event 并停止识别。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2014-12-16
    • 1970-01-01
    • 1970-01-01
    • 2023-04-09
    • 1970-01-01
    • 2017-03-08
    • 1970-01-01
    相关资源
    最近更新 更多