【发布时间】:2017-08-13 08:43:49
【问题描述】:
我有一个重叠很多的数据集。到目前为止,我使用 SVM 的结果并不好。对于可能在这两个数据集之间有所不同的模型,您有什么建议吗?
【问题讨论】:
标签: machine-learning deep-learning svm
我有一个重叠很多的数据集。到目前为止,我使用 SVM 的结果并不好。对于可能在这两个数据集之间有所不同的模型,您有什么建议吗?
【问题讨论】:
标签: machine-learning deep-learning svm
很容易通过插值其中一个类并预测另一个类来拟合数据集。但是,这种方法的问题在于,它不能很好地概括。您必须问自己的问题是,您是否可以根据其属性预测某个点的类别。如果不是,那么每个 ML 算法也将无法做到这一点。
那么你能做的唯一合理的事情就是为每个点收集更多的数据和更多的属性。也许通过添加第三个维度,您可以更轻松地分离数据。
【讨论】:
如果数据重叠太多,那么两者应该属于同一类,但我们知道它们不是。因此,有一些特征或变量将这些数据点分为两类。尝试为数据添加更多功能。
有时,只需将数据转换为不同的规模即可。
这两个类不需要平均分布,因为倾斜的数据分布可以单独处理。
【讨论】:
首先,你对“好结果”的标准是什么?你用的是什么风格的 SVM?对于大多数“好”的概念来说,简单的线性肯定会失败,但严重卷积的高斯核可能会从绘图上部区域的少数连续点中挖掘出一些东西。
我建议您对所提供的数据进行一些基本统计,看看它们是否真的如您所愿。我建议对初学者进行 T 检验。
如果您有其他尺寸,我强烈建议您使用它们。从您可以处理的最大输入量开始,然后从那里减少(主成分分析)。在我们了解数据的完整形状和分布之前,确定有用的算法的希望不大。
也就是说,我会先发制人地建议您在添加其他维度时研究光谱聚类算法。有些在密度方面很好,有些在连通性方面很好,而另一些则侧重于差距。
【讨论】: