【问题标题】:Azure PullAudioInputStream Not working accurately with Twilio VoiceAzure PullAudioInputStream 无法与 Twilio Voice 一起正常工作
【发布时间】:2021-01-26 15:54:06
【问题描述】:

我将 Twilio 媒体流与 Azure 认知服务(语音转文本)集成。我继承了speechsdk.audio.PullAudioInputStreamCallback 类将音频块发送到服务器。

import azure.cognitiveservices.speech as speechsdk
import queue

class SocketReaderCallback(speechsdk.audio.PullAudioInputStreamCallback):

    def __init__(self):
        super().__init__()
        self._q = queue.Queue()

    def read(self, buffer: memoryview) -> int:
        chunk = self._q.get()
        buffer[:len(chunk)] = chunk
        return len(chunk)

    def has_bytes(self):
        return True if self._q.qsize() > 0 else False

    def queueup(self,chunk):
        self._q.put(chunk)

    def close(self):
        print("AZ.Callback.Closed")

以下是转录类的代码。这里add_request 方法将音频块添加到上述回调类的队列中。回调类从队列中挑选块并上传到 Azure 服务器进行转录。

import azure.cognitiveservices.speech as speechsdk
import queue
from rule_engine.medium.azure_transcribe.azure_calback import SocketReaderCallback

class AzureTranscribe:

    def __init__(self, speech_config, on_response, user_id):
        self._on_response = on_response
        self.callback = SocketReaderCallback()
        wave_format = speechsdk.audio.AudioStreamFormat(samples_per_second=8000, bits_per_sample=8, channels=1)
        self._stream = speechsdk.audio.PullAudioInputStream(self.callback,wave_format)
        audio_config = speechsdk.audio.AudioConfig(stream=self._stream)
        self._speech_recognizer = speechsdk.SpeechRecognizer(speech_config=speech_config, language="en-IN", audio_config=audio_config)
        self._ended = False
        self.user_id = user_id
        self.initialize_once()
        self.state = None

    def initialize_once(self):
        # Connect callbacks to the events fired by the speech recognizer
        self._speech_recognizer.recognizing.connect(lambda evt: print('AZ.RECOGNIZING: {}'.format(evt)))
        self._speech_recognizer.recognized.connect(lambda evt: print('AZ.RECOGNIZED: {}'.format(evt)))
        self._speech_recognizer.session_started.connect(lambda evt: print('AZ.SESSION STARTED: {}'.format(evt)))
        self._speech_recognizer.session_stopped.connect(lambda evt: print('AZ.SESSION STOPPED {}'.format(evt)))
        self._speech_recognizer.canceled.connect(lambda evt: print('AZ.CANCELED {}'.format(evt)))
        self._speech_recognizer.start_continuous_recognition()

    def add_request(self, buffer):
        # buffer, self.state =  audioop.ratecv(bytes(buffer), 2, 2, 8000, 16000, self.state)
        self.callback.queueup(bytes(buffer))
    
    def terminate(self):    
        self._ended = True
        self._speech_recognizer.stop_continuous_recognition()
  • 如果我从音频文件上传音频块,转录是 准确。
  • 如果我从 twilio 调用上传音频块,转录是 非常糟糕。

Twilio 的采样率为 8 kHz,而 Azure 的预期采样率 为 16 kHz。然而,Azure 可以同时使用两种采样率并且提供的效果很差 两者的质量转录。

【问题讨论】:

  • 您能否添加有关您从 Twilio 发送的输入音频文件格式的更多详细信息。

标签: azure audio twilio azure-cognitive-services


【解决方案1】:

请使用语音服务 SDK 压缩音频输入流 API 通过 PullStream 或 PushStream 将压缩音频流式传输到语音服务。

我们推荐了一种将音频转换为支持格式的方法。 • 您可以使用FFMpeg 进行音频格式转换。音频文件正确的格式是 16kHz、16Bit 和 Mono。正确目标格式的命令行是: o ffmpeg.exe -i inputfile.wav -sample_fmt s16 -ac 1 -ar 16000 outputfile.wav

• 文档引用了 SoX,请参阅 https://docs.microsoft.com/en-us/azure/cognitive-services/speech-service/how-to-custom-speech-test-data#audio-data-for-testing

压缩音频输入流请关注doc

【讨论】:

    猜你喜欢
    • 2023-03-04
    • 1970-01-01
    • 1970-01-01
    • 2017-12-14
    • 2020-08-19
    • 2013-02-06
    • 2019-02-02
    • 2021-10-15
    • 2016-07-05
    相关资源
    最近更新 更多