【发布时间】:2018-06-23 06:26:51
【问题描述】:
我正在编写一个与语音相关的项目。我正在开发一个功能来实时区分声音中的人的声音。 我使用 Microsoft Azure Speaker Recognition API 来区分人们的声音。
根据 API 指南,我必须上传 WAV 文件才能接收音频并区分语音中的用户。 但是,我需要使用实时音频流来区分用户的声音。
所以我的问题是:如何使用实时音频流来实现说话人识别?
- 我能否使用 Azure Speaker Recognition API 获取实时音频,它只需要 WAV 文件?
- 或者除了这个 API 还有其他方法吗?
【问题讨论】:
-
有Kaldi等开源的说话人识别工具包,你可以用它们构建流式语音识别
标签: c# microsoft-cognitive speech mfcc speaker