【问题标题】:What is the sampling frequency of the audio generated by IBM Watson Text to Speech service?IBM Watson Text to Speech 服务生成的音频的采样频率是多少?
【发布时间】:2017-12-11 10:26:29
【问题描述】:

我正在使用 Watson Text to Speech 服务来生成 MP3 和 WAV 格式的音频文件。这些音频的默认采样频率是多少?有没有办法在点击 API 时指定采样率(对于 MP3 和 WAV)? Watson Speech to Text 建议对宽带模型使用 16 kHz 的音频。

【问题讨论】:

    标签: audio text-to-speech speech-to-text ibm-watson sampling


    【解决方案1】:

    默认采样率为 22,050 Hz,并使用 rate 参数指定。从文档中我可以看到它是可选参数。 FYR - https://console.bluemix.net/docs/services/text-to-speech/http.html#format

    【讨论】:

    • 非常感谢您的回复。我们可以说 Speech to text 为 22,050 Hz 频率的音频提供了最大的准确性吗?我尝试过以 44100 Hz 频率录制的立体声音频。它给出了不正确的结果。但是使用文本到语音生成的语音(默认频率为 22050 Hz),它可以提供准确的结果。
    • 我不知道准确性,但您是否尝试过使用 44100 的速率参数,例如 audio/wav;rate=44100 ?
    • 是的。 rate 参数不适用于 Speech to Text。它仍然给出错误的结果。
    【解决方案2】:

    这些信息很容易在文档中找到。

    TextToSpeech 语音创建为 22050 Hz,您可以强制不同的输出采样率,但服务只会在提供结果之前对其进行下采样/上采样。

    SpeechToText 通常支持宽带 16000 Hz 和窄带 8000 Hz。最好的办法是在 come 容器中使用音频,该容器在标题、flac、wav(不是 pcm)中具有采样率信息。 至于 SpeechToText,重要的是音频确实具有相关频谱中的信息,因此您不能将 8kHZ 电话通信上采样到 16kHZ 并将其发送到宽带模型。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2017-07-28
      • 2019-04-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-05-11
      相关资源
      最近更新 更多