【发布时间】:2022-10-25 21:09:10
【问题描述】:
我使用语音识别 python 库以 16khz 的单声道记录来自我的麦克风的音频字节,但我想使用接受 numpy 数组、频谱图和文件路径的新耳语库。写入文件需要太长时间,所以我想直接将数据转换为数组以将其传递给耳语
【问题讨论】:
标签: python audio speech-recognition openai-whisper
我使用语音识别 python 库以 16khz 的单声道记录来自我的麦克风的音频字节,但我想使用接受 numpy 数组、频谱图和文件路径的新耳语库。写入文件需要太长时间,所以我想直接将数据转换为数组以将其传递给耳语
【问题讨论】:
标签: python audio speech-recognition openai-whisper
尝试 librosa 库
librosa.load(path, *, sr=22050, mono=True, offset=0.0, duration=None, dtype=<class 'numpy.float32'>, res_type='soxr_hq')
【讨论】: