【发布时间】:2016-12-12 08:48:04
【问题描述】:
我正在编写一个应用程序,它应该接收音频并将其发送到 Bing Recognition API 以获取文本。 我使用了服务库,它适用于 wav 文件。因此,我编写了自己的流类来接收来自麦克风或网络 (RTP) 的音频,并将其发送到识别 API。当我在音频流前面添加 WAV 标头时,它会工作几秒钟。
调试显示,识别 api 读取表单流的速度快于由音频源填充(16k 采样率,16 位,单声道)。
所以我的问题是:有没有办法将识别 api 与实时(连续)音频流一起使用?
我知道有一个麦克风客户端的示例,但它仅适用于麦克风,我需要它用于不同的来源。
【问题讨论】:
-
您是否只想实时发送音频并在有人讲话时返回结果?或者您想发送任意长的音频流?也许如果您链接到麦克风示例,您的问题会更清楚。
-
我想实时发送音频,以便在讲话过程中获得部分结果。主要类似于示例文件夹中的microphone sample,但适用于不同的来源(例如 RTP)。但我希望我找到了解决方案(必须做更多的测试)。如果可行,我将创建一个带有描述的答案。
标签: c# speech-to-text bing microsoft-cognitive