【问题标题】:Interpreting classification report解读分类报告
【发布时间】:2018-09-06 08:39:43
【问题描述】:

我一直致力于使用 150 个文档(100 个训练和 50 个测试)实施 KEA 监督的关键短语提取方法。结果让我有点困惑。这是我的分类报告:

           precision    recall  f1-score   support

      0       0.97      1.00      0.98     29118
      1       0.00      0.00      0.00       951

avg / total       0.94      0.97      0.95     30069

我解释说 1 从未被预测过。你认为这是我没有足够的训练数据的情况吗?

【问题讨论】:

    标签: python machine-learning


    【解决方案1】:

    问题不在于你有足够的训练数据一般,而是具体来说没有足够的样本用于第 1 类
    从本质上讲,有几种方法可以解决这个问题:

    • 尝试增加案例 1 的样本数量:最明显的答案也可能不现实,因为那时您可能会首先使用更多的训练数据。但也有相关的方法,即
    • 数据增强:我不熟悉具体的算法,所以我不能说它是多么容易,但你可以在你的例子中添加一些形式的排列,仍然保持意义(即代表同一类),但差异足以作为“另一个训练样本”。
    • 加权类:根据您的学习算法的具体情况,您通常还可以指定某种形式的类权重,这样您就可以更多地“惩罚”算法对您感兴趣的类进行错误分类。

    一般来说,这是一项非常艰巨的任务,您不太可能会突然获得非常好的结果,但这些肯定会有助于改善您的案例,并帮助您更好地了解您的具体案例中出了什么问题. 另请注意,您添加的有关您的文档、培训程序等的信息越多(它可能是您正在使用的实施的参考/链接),您获得合适答案的可能性就越大。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2015-08-25
      • 1970-01-01
      • 1970-01-01
      • 2023-03-03
      • 1970-01-01
      • 2015-07-26
      • 2021-08-31
      相关资源
      最近更新 更多