【问题标题】:Is Speech-to-Text voice training data sampled at 48kHz still good for improving recognition of 16kHz speech以 48kHz 采样的 Speech-to-Text 语音训练数据是否仍然有助于提高对 16kHz 语音的识别?
【发布时间】:2020-09-12 00:31:01
【问题描述】:

我们正在使用按照documentation 以 .wav (RIFF) 格式以 16 位、16kHz 格式记录的数据来训练我们的 Azure 认知服务自定义语音模型。

但是,我们获得了以 48kHz 录制并编码为 MP3 的语音数据集。 Speech Studio 似乎能够毫无问题地使用这些数据训练服务,但我们想知道这样做是否会在更高的采样率下仅用于以更高的速率识别流数据,或者这无关紧要?

【问题讨论】:

    标签: speech-to-text azure-cognitive-services


    【解决方案1】:

    就音频质量而言,您所描述的采样率较高是可取的,但通常不会影响语音识别。只要您满足音频格式的最低要求,语音识别就可以正常工作。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-02-17
      • 2017-04-10
      • 1970-01-01
      相关资源
      最近更新 更多