【问题标题】:Watson Speech To Text service works faster for which type of audio file?Watson Speech To Text 服务对哪种类型的音频文件运行更快?
【发布时间】:2017-12-06 05:43:02
【问题描述】:

我已经尝试过用于 MP3 和 WAV 文件的 Watson Speech to Text API。根据我的观察,与 WAV 相比,如果以 MP3 格式提供相同长度的音频所需的时间更少。对于 MP3 文件,使用不同音频的 10 次连续 API 调用平均耗时 8.7 秒。另一方面,WAV 格式的相同输入平均需要 11.1 秒。服务响应时间是否取决于文件类型?建议使用哪种文件类型以更快地获得结果?

【问题讨论】:

  • 你的测量结果如何?这是在上传之后还是包括网络时间?
  • 包括网络时间。考虑到网络性能,我们可以考虑少 2-3 秒。在任何情况下,MP3 的运行速度都比 WAV 快。所以想知道性能是否受文件类型影响。
  • 我问是因为 mp3 文件通常小于 wav。你检查过这两种情况下传输了多少数据吗?
  • 是的,没错。我尝试过使用相同长度的音频,但与 wav 相比,mp3 文件的大小更小。

标签: audio ibm-cloud speech-to-text watson


【解决方案1】:

不同的编码格式有不同的比特率。 mp3 和 opus 是有损压缩格式(尽管适用于比特率不太低的语音识别),因此它们提供最低的比特率。如果您需要通过网络推送更少的字节,这通常对延迟更好,因此根据您的网络速度,您可以在使用较低比特率的编码时看到更短的处理时间。

但是,对于实际的语音识别过程(忽略通过网络传输的数据),所有编码都同样快,因为在识别开始之前,所有音频都经过解压缩(如有必要)并转换为目标模型的采样率(宽带或窄带)。

【讨论】:

  • 非常感谢。我认为这回答了我的问题。这完全取决于要求。如果需要低延迟,则可以使用有损编码格式。如果准确性至关重要并且可以接受一些延迟,则必须使用无损编码格式。
  • 是的,但请注意,如果您使用可接受的比特率,像 opus 这样的有损格式不会以可测量的方式降低准确性。使用 Opus,您可以获得两全其美、最佳延迟和不损失准确性。关键是选择正确的比特率:这是一个很好的列表,您可以从以下值开始:wiki.xiph.org/Opus_Recommended_Settings。这也是另一个有趣的资源:@​​987654322@
  • 非常感谢您的意见!
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2017-09-06
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多