【发布时间】:2018-09-26 16:42:36
【问题描述】:
我有音频文件说“left.wav”、“right.wav”等等,我想创建一个模型,它将音频作为输入和输出标签“左”或“右”等。
问题
如何将原始音频馈送到我的神经网络?
【问题讨论】:
标签: tensorflow neural-network audio-processing
我有音频文件说“left.wav”、“right.wav”等等,我想创建一个模型,它将音频作为输入和输出标签“左”或“右”等。
问题
如何将原始音频馈送到我的神经网络?
【问题讨论】:
标签: tensorflow neural-network audio-processing
scipy.io.wavfile.read() 函数将在 numpy 数组中返回采样率和整个音频。
然后您可以将其提供给您的网络。
import scipy
rate, numpy_audio = scipy.io.wavfile.read( "left.wav" )
如果你想做语音识别,请查看DeepSpeech,这是一个很大的项目,但你可能会从中得到一些好的想法。
对于更简单的介绍,Tensorflow 有一个 Simple Audio Recognition 教程。
要生成音频,您可能需要考虑 WaveNet - this is one particular implementation。
【讨论】: