【发布时间】:2018-03-07 21:59:59
【问题描述】:
我正在为 XGBoost 使用 R 包装器。在函数xgb.cv中,有一个folds参数说明
list 提供了使用预定义 CV 折叠列表的可能性 (每个元素必须是折叠索引的向量)。如果折叠是 提供时,将忽略 nfold 和分层参数。
那么,我是否只指定用于训练模型的索引并假设其余的将用于测试?例如,如果我的训练数据类似于
Feature1 Feature2 Target
1: 2 10 10
2: 7 1 9
3: 8 2 3
4: 8 10 7
5: 8 2 9
6: 3 7 3
并且我想使用 ((1,2,3), (4,5,6)) 和 ((4,5,6), (1,2,3) 的 (train, test) 索引进行交叉验证)) 我要设置folds=list(c(1,2,3), c(4,5,6))吗?
【问题讨论】:
-
caret::createFolds或caret::createDataPartition中的一个会为您完成艰苦的工作。你的例子可能是正确的。