【问题标题】:How to create and format an image dataset from scratch for machine learning?如何从头开始创建和格式化图像数据集以进行机器学习?
【发布时间】:2015-06-02 03:12:07
【问题描述】:

我只使用 .csv 格式的机器学习。我也使用过图像格式,但只有预制图像集(MNIST 等)。如果我要从头开始创建图像集,类标签通常是如何形成的?我是否必须手动为 jpeg 的图像命名?

最好的,杰里米

【问题讨论】:

  • 另外,jpeg 图像不能有相同的标题,如果所有标题都不同,ML 程序不会将每个图像识别为自己的类吗?
  • 或许问题应该迁移到crossvalidate.SE

标签: image machine-learning deep-learning


【解决方案1】:

我使用过以下格式的图像数据集:

  1. 类名作为文件夹:顾名思义,属于特定类的图像填充到特定文件夹中,文件夹名称代表该类。

例如,用于分类 Cats 与 Dogs 的数据集

-Dataset/
--Cats/
---all cat images here
--Dogs/
---all dogs images here
  1. 单个文件夹 + 文本文件:所有图像都转储到一个文件夹中 - 显然每个图像文件都有一个唯一的名称。 image_name : class 的键值对可以作为行存储在 csv 文件中。

例如

-Dataset/
--all images heree
--imagename_class.csv 
  1. 文件名中带有类的单个文件夹:所有图像都可以放在一个文件夹中,图像的名称具有类标签和一些变化的索引值。

例如

-Dataset/
--cat_1.jpg
--cat_2.jpg
--dog_1.jpg
--cat_3.jpg
--... 

希望这会有所帮助!

【讨论】:

    猜你喜欢
    • 2017-12-26
    • 2018-12-21
    • 2019-03-21
    • 2022-07-29
    • 1970-01-01
    • 1970-01-01
    • 2018-02-04
    • 2021-04-04
    • 2016-11-01
    相关资源
    最近更新 更多