【发布时间】:2020-08-04 00:14:36
【问题描述】:
我一直在 R 中使用 ranger 和 randomForest 函数。我特别感兴趣的是了解我试图预测的每个类的特征(预测变量)的重要性,而不是所有类的整体重要性。我知道如何使用 randomForest 中的 important() 函数来做到这一点,它似乎是默认行为:
library(randomForest)
set.seed(100)
rfmodel <- randomForest(Species ~ ., data = iris, ntree = 1000, importance = TRUE)
importance(rfmodel)
这会产生一个矩阵,其中包含三个类别中每个类别的每个特征的重要性
或者我正在运行的游侠:
library(ranger)
rangermodel<-ranger(Species ~ ., data = iris, num.trees = 1000, write.forest=TRUE, importance="permutation", local.importance=TRUE)
importance(rangermodel)
rangermodel$variable.importance
rangermodel$variable.importance.local
rangermodel$variable.importance 提供了特征对整个分类问题的重要性,但不是按类别。虽然 rangermodel$variable.importance.local 提供了每种情况的重要性,但也不是按类别。
游侠文档似乎没有提供这方面的信息。 我能找到的关于这个话题的唯一问题是这个:How can I separate the overall variable importance values when using Random forest? 但他们没有就如何使用 ranger 实现这一点得出结论。 如下更改游侠代码并没有提供我正在寻找的输出:
rangermodel<-ranger(Species ~ ., data = iris, num.trees = 1000, write.forest=TRUE, importance="impurity")
【问题讨论】:
标签: r machine-learning random-forest