【问题标题】:Random Forest in R: Difference between reported and observed error valuesR中的随机森林:报告和观察到的错误值之间的差异
【发布时间】:2015-03-22 13:51:38
【问题描述】:

我尝试在数据集上拟合随机森林。花了几个小时,但最终安装好了。使用的命令是: 模型

模型报告如下:

#

随机森林

13737 个样本 52 预测器 5 类:'A'、'B'、'C'、'D'、'E'

无预处理 重采样:自举(25 次)

样本量汇总:13737, 13737, 13737, 13737, 13737, 13737, ...

跨调整参数重新采样结果:

mtry   Accuracy    Kappa       Accuracy SD   Kappa SD

2    0.9888012  0.9858367  0.001844763  0.002329859
27   0.9882821  0.9851812  0.001874991  0.002365894
52   0.9820495  0.9773000  0.003680805  0.004649905

精度用于选择使用最大值的最佳模型。 用于模型的最终值是 mtry = 2。

#

当我对训练数据进行预测时,我得到了 100% 的准确率。

预测

表(预测,训练$classe)

预测 A B C D E

        A 3906    0    0    0    0
        B    0 2658    0    0    0
        C    0    0 2396    0    0
        D    0    0    0 2252    0
        E    0    0    0    0 2525

我预计它会达到模型报告的 ~98.9%。

我错过了什么?

感谢和问候,

【问题讨论】:

    标签: r


    【解决方案1】:

    此问题的相同答案适用:https://stackoverflow.com/a/51690010/9684157

    您可以将这些值分别解释为 in-sample 精度,无论是否重新采样。

    当您拟合模型时,包 caret 会执行 25 次重复的自举重采样,这可以在您的模型输出中看到。因此,准确度值基于 25 x 13737 个观测值。为了创建混淆矩阵,您使用最终模型(mtry = 2 的模型)来预测训练样本的结果,该样本的长度为 13737。因此,对应的略有差异是正常的准确度。

    您在评估拟合优度时需要小心,因为您正在使用相同的数据集训练和评估您的模型。毫不奇怪,您获得了很高的准确性。使用不可见的数据集评估最终模型总是很好的,以确保其性能并检测可能的过度拟合问题。

    【讨论】:

      猜你喜欢
      • 2016-04-20
      • 1970-01-01
      • 2018-01-18
      • 1970-01-01
      • 2021-07-12
      • 2017-05-03
      • 2016-01-24
      • 1970-01-01
      • 2013-07-06
      相关资源
      最近更新 更多