【发布时间】:2019-07-09 17:59:04
【问题描述】:
我注意到对于一些运行:
train=as.h2o(u)
mod = h2o.glm(family= "binomial", x= c(1:15), y="dc",
training_frame=train, missing_values_handling = "Skip",
lambda = 0, compute_p_values = TRUE, nfolds = 10,
keep_cross_validation_predictions= TRUE)
对于模型的某些 cv 迭代,AUC 的交叉验证指标摘要中有 NaN。
例如:
print(mod@model$cross_validation_metrics_summary["auc",])
交叉验证指标摘要:
mean sd cv_1_valid cv_2_valid cv_3_valid cv_4_valid cv_5_valid cv_6_valid cv_7_valid cv_8_valid cv_9_valid cv_10_valid
auc 0.63244045 0.24962118 0.25 0.6666667 0.8095238 1.0 0.6666667 0.46666667 NaN NaN 1.0 0.2
当我设置较小的 nfolds=7 时,CV 中的 NaN 似乎不太频繁出现。
应该如何解释这些 NaN 值以及 h2o 交叉验证何时输出它们?
我想在迭代中无法正确评估 AUC 时会发生这种情况。我的训练集有 70 行完整的行。
这样的 AUC 交叉验证结果(包含 NaN)是否可以认为是可靠的?
【问题讨论】:
-
您可以发布完全可重现的代码 sn-p 吗?这样我们就可以尝试重现您所看到的内容。谢谢!
-
你规范化数据了吗?
-
我的输入数据框非常简单并且没有缩放:[drive.google.com/file/d/1UiIkxlHCq1tJZNOH6hQD30gEMaPdmhgh/… 如果在 h2o.glm 中设置种子 = 1234,您将获得 3 个 NaN。
标签: r cross-validation h2o glm auc