【问题标题】:Formatting mp3 files to spectrograms for CNN machine learning将 mp3 文件格式化为 CNN 机器学习的频谱图
【发布时间】:2016-06-21 16:56:14
【问题描述】:

我玩得很开心,并且从使用 MNIST 数据集中学到了很多东西,但我想扩展到使用我自己的训练数据,我将 theano 与 keras 一起使用。但是,我在构思如何创建训练数据时遇到了非常困难的问题。

我查看了MNIST的结构,发现作为数据,它的第一部分是图像的分类,其余部分是从0到100的单个像素亮度。

我的第一个想法是使用像 thisthis 这样的频谱图,但我不明白如何构造数据以便 CNN 可以读取它。有什么想法或建议吗?

【问题讨论】:

  • 如何构造数据是什么意思?究竟是什么你不明白?您是否尝试过试验或布置数据?你的结果是什么?

标签: python python-2.7 machine-learning theano keras


【解决方案1】:

我可能无法准确回答这个问题。

我将尝试解释 MNIST 数据集的格式,我将使用以下示例。

假设您希望在训练数据中对具有四个不同类别标签的图像进行分类 -> carbikebus飞机。 所有图像都是彩色图像,每个 RGB 具有 255 个像素值。我将亮度/不透明度值排除在此示例中作为属性。所有图像都已标准化,尺寸为 28x28(只是任意尺寸)。这给了我们 784 个像素,因为每个像素都有 3 个 RGB 值,所以这给了我们 784x3 = 2352 个属性值。

每个实例的输出(在 MNIST 数据集中)表示为一个热向量表示。汽车、自行车、公共汽车和飞机的 1 个热向量表示分别为 1000、0100、0010 和 0001。

假设 MNIST 数据集有 1000 个实例进行训练,那么它将采用以下结构。它将由 1000 个元组组成,其中每个元组是一个输入向量(长度为 2352 个属性)和一个输出向量(一个热表示,长度为 4 个属性)的组合。

这是为了增加清晰度。

([12, 51, 16, 17, ......., 12], [0, 0, 1, 0])

([55, 125, 71, 244, ....., 10], [1, 0, 0, 0])

......

其中元组中的第一个列表长度为 2352,元组中的第二个列表长度为 4。总共有 1000 个元组,每个元组代表一个训练实例。

如果您愿意,可以查看code,我在其中创建了一个类似于 MNIST 格式的数据集。

【讨论】:

  • 谢谢你,这是非常大的帮助!并感谢您提供其结构的代码示例!
猜你喜欢
  • 2017-12-26
  • 2013-05-04
  • 1970-01-01
  • 2021-03-08
  • 2017-03-26
  • 1970-01-01
  • 2020-02-27
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多