【发布时间】:2017-09-24 01:28:04
【问题描述】:
我正在使用集成方法(随机森林、xgbclassifier 等)进行分类。
一个重要方面是特征重要性预测,如下所示:
Importance
Feature-A 0.25
Feature-B 0.09
Feature-C 0.08
.......
该模型的准确度得分约为 0.85;显然 Feature-A 占主导地位,所以我决定删除 Feature-A 并重新计算。
但是,在移除 Feature-A 后,我仍然发现性能不错,准确度在 0.79 左右。
这对我来说没有意义,因为 Feature-A 为模型贡献了 25%,如果去掉,为什么准确度分数几乎没有影响?
我知道集成方法具有将“弱”特征组合成“强”特征的优势,因此准确度得分主要依赖于聚合,对重要特征移除不太敏感?
谢谢
【问题讨论】:
-
您是否通过交叉验证检查了您的模型?您是否查看了具有弱特征和响应的图表,它们明显是相对的吗?我不知道梯度提升,但随机森林可能会在没有弱特征影响的情况下相应地构建树。但是,如果没有答案的链接,我认为最好将它们从您的模型中删除。估计器越多,梯度提升可能会变得更糟,使用更少的估计器(更快)可以构建随机森林。
-
交叉发布:stats.stackexchange.com/q/276028/2921,stackoverflow.com/q/43637662/781723。请do not post the same question on multiple sites。每个社区都应该诚实地回答问题,而不会浪费任何人的时间。
标签: python scikit-learn feature-selection ensemble-learning