【问题标题】:Binary Classification: what if the class I care most is only small portion of the data?二元分类:如果我最关心的类只是数据的一小部分怎么办?
【发布时间】:2013-09-22 23:01:42
【问题描述】:

我正在研究一个二元分类问题。说A班和B班。 但问题是 A 和 B 的类别先验分布就像 90% 和 10%。所以我尝试过的大多数分类算法,它们倾向于将大多数情况分类为 A 类,虽然 0/1 准确率很高,但 B 类的类精度和召回率很糟糕。我该如何更改?

【问题讨论】:

    标签: machine-learning data-mining


    【解决方案1】:

    有两种基本方法:

    • 对较小的类进行过采样(重复向量以使比例更均等,您还可以对这些数据应用一些小噪声以获得更“有价值”的数据)
    • 使用您的模型支持的一些类加权方案

    尤其是the exact problem for Support Vector Machines

    还有一件事 - 构建了一些评估措施来处理这种不成比例,特别是MCC(马修斯相关系数)可用于评估非比例数据上的模型质量。

    【讨论】:

      【解决方案2】:

      This research article 还定义了一些通用的类加权方案,您可以将它们作为您首选的学习算法中的训练标准。

      在基于成本的类别加权中,您更新学习算法以“按原样”使用您的数据处理训练过程中的不均匀类别,而采样涉及数据级方法。

      上述文章中提出的一些加权方案将两个类的准确性视为同等重要,而另一些则将少数类的准确性视为比多数类的准确性更重要。

      【讨论】:

        猜你喜欢
        • 2016-07-31
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2017-06-28
        • 2017-05-26
        • 1970-01-01
        • 2015-05-27
        • 2020-05-14
        相关资源
        最近更新 更多