【发布时间】:2017-11-15 17:39:38
【问题描述】:
我正在处理对不同变量进行数值观测的传感器数据。我想将它们分为三个标签 A、B、C。
但是,这里的情况有所不同。
我有 30 个实例用于训练(或标记数据)和 20 个实例用于测试(未标记数据)。
现在,这些实例是传感器记录的变量和参数的时间序列记录。每个实例(或单个观察)都是一个 CSV,如 screenshot 文件中所示。
CSV文件的名字就是标签,这个标签我需要分类。所以,我有 30 个 CSV 文件或实例(或 30 个标签)和 20 个实例或 CSV 文件用于测试。
所有 CSV 文件都具有相同的数据结构。任何文件中都没有标签,因为它们本身是单个观察值(形状为 5000、12)并且完全代表单个观察值,并且文件名例如 classA.csv ,其中 A 类是目标变量
我想弄清楚,我该如何放置这些数据(训练数据的每个观察(或类)都是一个 csv 文件,每个文件包含 5000 个观察)。
请提出建议。
提前致谢。
【问题讨论】:
-
您对数据的性质有任何了解吗?机器学习算法可以将一个类别与另一个类别区分开来,但它可以为它选择一些随机数据差异,它不会给你带来任何好处。您可以在此处添加每个文件的“标签”列和该文件的位置名称。当连接所有文件并将所有数据提供给 xgboost 时。也许你会得到一些有用的东西,也许不是。不过你可以试试。
标签: python python-3.x machine-learning data-science