【问题标题】:can validated model be used to do prediction whole dataset?可以使用经过验证的模型来预测整个数据集吗?
【发布时间】:2018-09-28 02:44:49
【问题描述】:

我们一直在大约 15k 行的数据集上运行“gbm”模型。我们直接实施了 10 折交叉验证来提出一个交叉验证模型,我们用它来在同一个数据集上再次进行预测。

这可能导致模型过拟合,训练 AUC 约为 0.99,cv AUC 约为 0.92。预测的 AUC 也很高,约为 0.99。

审阅者要求我们使用保留数据集验证模型。 我们假设我们会将数据拆分为保留数据和训练数据。然后训练数据将再次进行 kfold 交叉验证。然后将使用保留数据集验证该模型。我的最后一个问题是我们是否可以在整个数据集上再次使用经过验证的模型进行预测?

【问题讨论】:

  • 您可以根据需要使用经过验证的模型,但您应该单独报告保持数据集的性能,作为对实际模型性能的最佳估计。

标签: r validation machine-learning cross-validation gbm


【解决方案1】:

你可以...应该的问题取决于你想要描绘的内容。

理想情况下,您希望能够证明您的模型能够很好地概括新数据(保留),并将其与模型在训练数据上的表现进行比较。如果您的模型在两者之间的性能存在很大差异,则您可能过度拟合数据。

我认为一次预测所有数据(训练和保持)没有多大意义,因为它无助于展示模型对看不见的数据进行预测的能力。

您的目标是在 k-CV 期间提供训练数据的性能,然后是在holdout 期间。

根据您的 k-CV 设置,您将在整个训练集上训练模型,然后在比较之前对两者进行预测。您需要更具体地描述您的确切设置。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2022-07-05
    • 2019-01-10
    • 2016-11-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-02-05
    • 2018-12-01
    相关资源
    最近更新 更多