【发布时间】:2017-12-11 10:26:29
【问题描述】:
我正在使用 Watson Text to Speech 服务来生成 MP3 和 WAV 格式的音频文件。这些音频的默认采样频率是多少?有没有办法在点击 API 时指定采样率(对于 MP3 和 WAV)? Watson Speech to Text 建议对宽带模型使用 16 kHz 的音频。
【问题讨论】:
标签: audio text-to-speech speech-to-text ibm-watson sampling
我正在使用 Watson Text to Speech 服务来生成 MP3 和 WAV 格式的音频文件。这些音频的默认采样频率是多少?有没有办法在点击 API 时指定采样率(对于 MP3 和 WAV)? Watson Speech to Text 建议对宽带模型使用 16 kHz 的音频。
【问题讨论】:
标签: audio text-to-speech speech-to-text ibm-watson sampling
默认采样率为 22,050 Hz,并使用 rate 参数指定。从文档中我可以看到它是可选参数。 FYR - https://console.bluemix.net/docs/services/text-to-speech/http.html#format
【讨论】:
这些信息很容易在文档中找到。
TextToSpeech 语音创建为 22050 Hz,您可以强制不同的输出采样率,但服务只会在提供结果之前对其进行下采样/上采样。
SpeechToText 通常支持宽带 16000 Hz 和窄带 8000 Hz。最好的办法是在 come 容器中使用音频,该容器在标题、flac、wav(不是 pcm)中具有采样率信息。 至于 SpeechToText,重要的是音频确实具有相关频谱中的信息,因此您不能将 8kHZ 电话通信上采样到 16kHZ 并将其发送到宽带模型。
【讨论】: