【问题标题】:Classification of multidimensional data多维数据分类
【发布时间】:2017-09-09 10:27:32
【问题描述】:

我想对一些多维数据进行分类:

输入数据如下:

Data1: [[a1,b1,f1], [a2,b2,f2], ... [an,bn,fn]] where: fn = F(an,bn) --> ClassA
Data2: [[c1,d1,g1], [c2,d2,g2], ... [cn,dn,gn]] where: gn = G(cn,dn) --> ClassB
...

因此,给定 Datax,如下所示,我们希望将其分类为我们拥有的有限类之一:

Datax: [[x1,y1,z1], [x2,y2,z2], ... [xn,yn,zn]] where: zn = Z(xn,yn) --> which class?

我可能会为每条记录展平数组并训练我的分类器:

Data1: [a1,b1,f1,a2,b2,f2,...,an,bn,fn]

但我认为,因为第三个值本身是前两个值的函数(例如 fn = F(an,bn)),所以我应该在训练中考虑这种关系,而不是使用平面数组。

这有什么不同吗?或者解决这个问题的最佳方法是什么?

【问题讨论】:

    标签: algorithm machine-learning classification training-data supervised-learning


    【解决方案1】:

    如果每个元组的第 3 个数据是相同确定性函数的乘积(每行可以不同,但​​行的每个三元组必须相同) 那么你可以简单地削减 zn,因为它不会带来任何新信息。

    例如:z1 = 3x1 + 2y1 ; z2 = 3x1 + 2y1 ; [...] ; zn = 3xn + 2yn

    如果不是这样,那么你应该离开 z1。

    这么说,我认为您可以将数组展平,因为大多数模型会自动理解这些依赖关系。

    【讨论】:

    • 谢谢,但是是的,每个班级的功能都不同,但我们不知道它们是什么。实际上,我已经简化了问题,我担心通过展平数组,模型无法找到依赖项。基本上,n==200,这使得每条记录都是 600 个数字的数组。因此,在每个类中,我们都有一些数据记录,每个数据记录由 600 个数字组成的数组,其中 200 个数字是其他 400 个数字zn = F (xn,yn) 的函数,这些函数对于一个类的记录是相同的,但不同的不同的类别
    猜你喜欢
    • 2013-05-17
    • 1970-01-01
    • 2017-03-20
    • 1970-01-01
    • 2014-02-01
    • 2017-08-20
    • 1970-01-01
    • 2017-01-26
    • 1970-01-01
    相关资源
    最近更新 更多