【问题标题】:Do you have any suggestions for a Machine Learning method that may actually learn to distinguish these two classes?您对可以真正学会区分这两个类别的机器学习方法有什么建议吗?
【发布时间】:2017-08-13 08:43:49
【问题描述】:

我有一个重叠很多的数据集。到目前为止,我使用 SVM 的结果并不好。对于可能在这两个数据集之间有所不同的模型,您有什么建议吗?

Scatter plot from both classes

【问题讨论】:

    标签: machine-learning deep-learning svm


    【解决方案1】:

    很容易通过插值其中一个类并预测另一个类来拟合数据集。但是,这种方法的问题在于,它不能很好地概括。您必须问自己的问题是,您是否可以根据其属性预测某个点的类别。如果不是,那么每个 ML 算法也将无法做到这一点。

    那么你能做的唯一合理的事情就是为每个点收集更多的数据和更多的属性。也许通过添加第三个维度,您可以更轻松地分离数据。

    【讨论】:

    • 您好 Thomaz,非常感谢您的评论,我们可能有其他属性可以帮助区分这两个类。数据量是个问题,2个类也很不平衡。我可以通过它们的直方图注意到它们的值重叠很多,所以我认为没有任何方法能够将它们分开。
    • 我对你的“如果可以预测”这句话有异议。机器学习(尤其是深度学习)的存在,部分是为了找到人类思维在合理时间内不会发现的差异,或者根本找不到。
    • 尤其是图像深度学习正在执行我们知道如何立即完成的任务。对象分类、NLP 和语义分割只是三个例子。当然,我们不能以手动的方式完成这项工作,但大多数 ML 任务仍然由专家在合理的时间内完成单点解决。 Andrew Ng 更深入的解释:hbr.org/2016/11/…
    【解决方案2】:

    如果数据重叠太多,那么两者应该属于同一类,但我们知道它们不是。因此,有一些特征或变量将这些数据点分为两类。尝试为数据添加更多功能。

    有时,只需将数据转换为不同的规模即可。

    这两个类不需要平均分布,因为倾斜的数据分布可以单独处理。

    【讨论】:

      【解决方案3】:

      首先,你对“好结果”的标准是什么?你用的是什么风格的 SVM?对于大多数“好”的概念来说,简单的线性肯定会失败,但严重卷积的高斯核可能会从绘图上部区域的少数连续点中挖掘出一些东西。

      我建议您对所提供的数据进行一些基本统计,看看它们是否真的如您所愿。我建议对初学者进行 T 检验。

      如果您有其他尺寸,我强烈建议您使用它们。从您可以处理的最大输入量开始,然后从那里减少(主成分分析)。在我们了解数据的完整形状和分布之前,确定有用的算法的希望不大。

      也就是说,我会先发制人地建议您在添加其他维度时研究光谱聚类算法。有些在密度方面很好,有些在连通性方面很好,而另一些则侧重于差距。

      【讨论】:

        猜你喜欢
        • 2020-04-28
        • 2011-05-11
        • 2020-06-26
        • 2020-02-21
        • 2015-10-06
        • 2019-01-26
        • 1970-01-01
        • 2015-03-28
        • 2014-07-02
        相关资源
        最近更新 更多