【问题标题】:How do i create and train tensorflow model with audio inputs?如何使用音频输入创建和训练 tensorflow 模型?
【发布时间】:2018-09-26 16:42:36
【问题描述】:

我有音频文件说“left.wav”、“right.wav”等等,我想创建一个模型,它将音频作为输入和输出标签“左”或“右”等。

问题

如何将原始音频馈送到我的神经网络?

【问题讨论】:

    标签: tensorflow neural-network audio-processing


    【解决方案1】:

    scipy.io.wavfile.read() 函数将在 numpy 数组中返回采样率和整个音频。

    然后您可以将其提供给您的网络。

    import scipy
    rate, numpy_audio = scipy.io.wavfile.read( "left.wav" )
    

    如果你想做语音识别,请查看DeepSpeech,这是一个很大的项目,但你可能会从中得到一些好的想法。

    对于更简单的介绍,Tensorflow 有一个 Simple Audio Recognition 教程。

    要生成音频,您可能需要考虑 WaveNet - this is one particular implementation

    【讨论】:

    • 就这样?仅此而已?
    • 是不是太容易了? :)
    • 你在做语音识别吗?
    • 在我的回答中为你添加了一些链接
    • 嗨,非常感谢。是的,我只是想使用 tensorflow 创建一个基本的语音识别模型。 :)
    猜你喜欢
    • 2018-02-27
    • 1970-01-01
    • 2020-06-07
    • 2020-06-07
    • 1970-01-01
    • 1970-01-01
    • 2018-02-12
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多