【问题标题】:Odd results with the model in wekaweka 中模型的奇怪结果
【发布时间】:2013-05-18 20:39:37
【问题描述】:

我正在使用 Weka Gui - Explorer 和 我想根据类{男性,女性}对我的数据进行分类。 我使用 MultiBoostAB 分类器和 REPTree 分类器作为基础。 我正在尝试使用训练集(557 个实例)评估我的分类器的准确性

然后是一个包含大约 300 个属性的测试集(200 个实例)。准确率为 83,5% - 167 个正确分类的实例 在 200 中,kappa 统计量为 0.67。我保存了这个模型并用它来预测

其他未知数据的标签(男性或女性)获得几乎相同的好结果。 然后我将训练集的大小增加到 1000 个实例,看看是否 我可以提高分类器的准确率。我得到了以下结果:

  • 运行 360 个实例的测试集 --> 87.0423 % 正确分类的实例和 kappa 统计 0,7335
  • 运行 200 个实例的测试集 --> 59% 正确分类的实例和 kappa 统计量 0,18

(它将我的大部分数据预测为女性) 当我增加训练集的大小时,为什么我的模型会变差?

【问题讨论】:

    标签: java weka


    【解决方案1】:

    好吧,如果没有实际查看和分析您的训练数据,这真的很难说。

    我的第一个猜测是,您添加到训练集中的额外 443 个实例非常不同,因此分类器学习了一个完全不同的模型。

    如果您只在这 443 个实例上训练模型会发生什么?如果您的测试集的准确度更差,您就知道您的训练数据可能不是最好的泛化数据。

    【讨论】:

    • @alkis 没问题。如果没有,请告诉我们您的结果,也许我们仍然可以追根溯源。
    猜你喜欢
    • 2019-09-16
    • 2016-03-15
    • 2012-03-24
    • 2015-09-16
    • 2013-03-29
    • 2011-10-07
    • 1970-01-01
    • 1970-01-01
    • 2016-01-03
    相关资源
    最近更新 更多