【问题标题】:Classification using Multiple CSV files with filename as label使用以文件名作为标签的多个 CSV 文件进行分类
【发布时间】:2017-11-15 17:39:38
【问题描述】:

我正在处理对不同变量进行数值观测的传感器数据。我想将它们分为三个标签 A、B、C。

但是,这里的情况有所不同。

我有 30 个实例用于训练(或标记数据)和 20 个实例用于测试(未标记数据)。

现在,这些实例是传感器记录的变量和参数的时间序列记录。每个实例(或单个观察)都是一个 CSV,如 screenshot 文件中所示。

CSV文件的名字就是标签,这个标签我需要分类。所以,我有 30 个 CSV 文件或实例(或 30 个标签)和 20 个实例或 CSV 文件用于测试。

所有 CSV 文件都具有相同的数据结构。任何文件中都没有标签,因为它们本身是单个观察值(形状为 5000、12)并且完全代表单个观察值,并且文件名例如 classA.csv ,其中 A 类是目标变量

我想弄清楚,我该如何放置这些数据(训练数据的每个观察(或类)都是一个 csv 文件,每个文件包含 5000 个观察)。

请提出建议。

提前致谢。

【问题讨论】:

  • 您对数据的性质有任何了解吗?机器学习算法可以将一个类别与另一个类别区分开来,但它可以为它选择一些随机数据差异,它不会给你带来任何好处。您可以在此处添加每个文件的“标签”列和该文件的位置名称。当连接所有文件并将所有数据提供给 xgboost 时。也许你会得到一些有用的东西,也许不是。不过你可以试试。

标签: python python-3.x machine-learning data-science


【解决方案1】:

我建议阅读此链接以了解 Python 的 CSV 接口: https://docs.python.org/2/library/csv.html

您的基本步骤是:

  1. 将 Python 指向存储数据的目录
  2. 遍历此目录中的文件
  3. 对于每个文件: 使用 Python 的 CSV 接口提取数据并将其放入您的数据结构中。解析 CSV 时,您将拥有一组行,您可以遍历这些行以提取数据。我建议您查看“简短使用示例”以了解如何访问数据。

【讨论】:

  • 我无法从此链接读取熊猫中的不同文件。
猜你喜欢
  • 1970-01-01
  • 2020-09-02
  • 1970-01-01
  • 2023-02-05
  • 2014-06-09
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多