【发布时间】:2015-03-07 21:33:30
【问题描述】:
在具有一些特征的数据上,我训练了一个用于回归目的的随机森林以及梯度增强回归树。对于两者,我计算了特征重要性,我发现它们是相当不同的,尽管它们获得了相似的分数。
对于随机森林回归:
MAE: 59.11
RMSE: 89.11
Importance:
Feature 1: 64.87
Feature 2: 0.10
Feature 3: 29.03
Feature 4: 0.09
Feature 5: 5.89
对于梯度提升回归树:
MAE: 58.70
RMSE: 90.59
Feature 1: 65.18
Feature 2: 5.67
Feature 3: 13.61
Feature 4: 4.26
Feature 5: 11.27
这是为什么?我想可能是因为使用梯度增强回归树,树比随机森林更浅。但我不确定。
【问题讨论】:
-
没有理由它们应该相同,因为每种算法计算它们的方式不同。特征重要性不是一个定义明确的属性,比如预测准确性。
-
@elyase 我认为计算特征重要性的方法与基于集成的树算法的类型无关。可能如此处所述:stackoverflow.com/questions/15810339/…
-
相关代码我已经贴出来了。
标签: scikit-learn regression random-forest