【问题标题】:What if K in K-Fold Cross Validation is Too Small?如果 K 折交叉验证中的 K 太小怎么办?
【发布时间】:2020-04-14 10:39:55
【问题描述】:

与数据集相比,使用小的 K 值会有什么后果?

【问题讨论】:

    标签: machine-learning statistics dataset data-science k-fold


    【解决方案1】:

    K 的值指定您计划将数据集拆分成的折叠数。 K 的较小值意味着数据集被拆分为更少的部分,但每个部分包含的数据集比例较大。

    获取一个包含 100 行的数据集。

    • 2 折交叉验证 - 每折将包含 50 行。
    • 10 折交叉验证 - 每折将包含 10 行。

    这样,在训练时,10 折交叉验证将有 90-10 的训练测试拆分,而 2 折交叉验证将有 50-50 的训练测试拆分。

    使用更多折叠,将为模型提供更多要训练的数据,但需要更多时间,因为它必须单独训练和验证K

    【讨论】:

      【解决方案2】:

      K-fold 交叉验证中的 K 表示我们希望将训练数据分成多少等份,并对给定的有限训练数据执行 K 次重新采样。

      正面:

      • 即使数据有限,也可以开发出好的模型。
      • 我们获得了超参数的最佳值(KNN 中的 k、朴素贝叶斯中的 alpha 等),这为我们提供了最佳性能指标(准确度、AUC、精度等)。

      否定:

      • 当我们对模型进行 K 次训练时,计算最佳超参数所需的时间会增加 K 次。

      【讨论】:

        猜你喜欢
        • 2016-01-15
        • 2018-08-29
        • 2017-06-09
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2017-07-02
        • 2016-11-15
        • 2020-08-29
        相关资源
        最近更新 更多