【发布时间】:2020-06-12 23:14:15
【问题描述】:
1) 我尝试回归随机森林来训练包含 4 个自变量的 185 行。 2 个分类变量各有 3 个水平和 13 个水平。另外 2 个变量是数值连续变量。
我尝试了 10 倍交叉验证的 RF,重复 4 次。 (我没有缩放因变量,这就是 RMSE 如此之大的原因。)
我猜 mtry 大于 4 的原因是分类变量总共有 3+13= 16 个级别。但如果是这样,为什么它不包括数字变量编号?
185 samples
4 predictor
No pre-processing
Resampling: Cross-Validated (10 fold, repeated 4 times)
Summary of sample sizes: 168, 165, 166, 167, 166, 167, ...
Resampling results across tuning parameters:
mtry RMSE Rsquared MAE
2 16764183 0.7843863 9267902
9 9451598 0.8615202 3977457
16 9639984 0.8586409 3813891
RMSE was used to select the optimal model using the smallest value.
The final value used for the model was mtry = 9.
请帮助我理解 mtry。
2) 另外,每一折的样本量是 168,165,166,....,为什么样本量会发生变化?
sample sizes: 168, 165, 166, 167, 166, 167
非常感谢。
【问题讨论】:
标签: r random-forest r-caret interpretation