【发布时间】:2018-09-28 02:44:49
【问题描述】:
我们一直在大约 15k 行的数据集上运行“gbm”模型。我们直接实施了 10 折交叉验证来提出一个交叉验证模型,我们用它来在同一个数据集上再次进行预测。
这可能导致模型过拟合,训练 AUC 约为 0.99,cv AUC 约为 0.92。预测的 AUC 也很高,约为 0.99。
审阅者要求我们使用保留数据集验证模型。 我们假设我们会将数据拆分为保留数据和训练数据。然后训练数据将再次进行 kfold 交叉验证。然后将使用保留数据集验证该模型。我的最后一个问题是我们是否可以在整个数据集上再次使用经过验证的模型进行预测?
【问题讨论】:
-
您可以根据需要使用经过验证的模型,但您应该单独报告保持数据集的性能,作为对实际模型性能的最佳估计。
标签: r validation machine-learning cross-validation gbm