【问题标题】:Wrong classification to multiple classes with different fraction of classes对具有不同类别分数的多个类别的错误分类
【发布时间】:2014-08-14 11:33:55
【问题描述】:

我鼓励解决下一个问题: 我正在尝试对很多文本文档进行分类。

有 20 类:1 正常,19 - 异常。 当我使用朴素贝叶斯分类时,我得到以下结果:分类适用于 19 个类,但对于“正常”类,我得到了许多错误分类错误:“正常”类别中的几乎所有案例都被归类为其他(非正常)类别。

有我的问题:

  • 我应该如何为“正常”类选择训练集? (现在,我刚好适合 对具有“正常”类别的文本分类器集,具有 1/20 比例)。
  • 可以这样指定分类器:如果属于的概率 某些类小于某个阈值,则必须设置分类器
    此样本的类别(例如正常)?

【问题讨论】:

    标签: machine-learning nlp scikit-learn text-classification


    【解决方案1】:

    每个类的实例数量很可能不平衡导致问题。您需要在最终类估计上定义某种先验以规避不平衡实例的问题,并且您需要通过交叉验证微调此先验的外生参数。我猜 Dirichlet Prior 用于多项式 NB。

    【讨论】:

      【解决方案2】:

      我不确定是否有全貌,但实际上您似乎只有 2 个类别“正常”和“异常”,它们的数量不平衡,因此是优先的。

      为了回答您的第一个问题,在这种情况下,我会尝试对您的正常课程进行过度采样以进行训练(多次传递相同的“正常”实例以“伪造”更大的音量),看看它是否会提高您的表现。

      我不明白你的第二个问题。

      【讨论】:

      • 非常感谢,已经有了很大的改进!我尝试解释:例如,我使用每个类别的训练集 1000 个示例。因此,我对 19 个(异常类别)使用 1000 个示例,对正常类别使用 19 000 个示例。它有助于平衡训练集并获得很大的改进。
      猜你喜欢
      • 1970-01-01
      • 2020-11-20
      • 2015-07-05
      • 2017-07-31
      • 1970-01-01
      • 2014-06-22
      • 2012-08-21
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多