【发布时间】:2012-09-09 11:17:06
【问题描述】:
有没有办法在大型(大约 10gb)xdf(revolution R 格式)文件上运行随机森林?显然我可以尝试 rxReadXdf 并将其转换为数据帧......但我的机器只有 8gb 内存,将来我可能会处理更大的数据集。例如,使用 foreach 循环,我想在我的四核机器上运行 1000 棵树:
#'train.xdf" is a 10gb training data set
rf<- foreach(ntree=rep(250, 4), .combine=combine,
.packages='randomForest') %do%
randomForest(amount2~.,data="train", ntree=ntree, importance=TRUE,
na.action=na.omit, replace=FALSE)
但 randomForest 无法接收“train”(一个 xdf)文件。有没有办法直接在 xdf 上运行随机森林而不读取数据帧?
干杯, agsub
【问题讨论】:
-
我认为这是不可能的,但我从未使用过 xdf 文件。相反,我会尝试将数据分成更小的块,在这些块上训练随机森林,并在所有块组合的最佳特征上构建最终模型。不过这很麻烦。
-
是的,这可能就是我现在要走的路
-
它的好处是,如果数据分析很容易,我就不会有工作:)
标签: r random-forest