【问题标题】:Error bars in feature selection increase when using more features?使用更多功能时,功能选择中的错误栏会增加?
【发布时间】:2018-11-28 19:08:17
【问题描述】:

我正在关注this example 以使用随机森林确定特征重要性。当使用大量特征并且仅使用这些特征的一个子集时,我分别观察到以下结果:

在使用所有可能的功能时,误差线急剧增加是否有特殊原因?负数有什么意义吗? (注意:两个图中 x 轴上的特定标签不一定对应。)

【问题讨论】:

    标签: python scikit-learn random-forest training-data feature-selection


    【解决方案1】:

    当您只使用最重要的功能时,发生错误的可能性较少(或者模型的机会不正确地学习它不应该的模式)。

    不使用特征重要性

    • 您的模型有很大的机会,您的模型是不应该的,因此不应该并重视较小的重要特征。
    • 此外,随机森林是决策树的集合,有些人可能会捕获正确的特征重要性,有些可能不是。
    • 最重要的是,由于在一些树上,它们可能绝对忽略了优势或最重要的重点。虽然有些人可能会被正确捕捉它
    • 因此,频谱的两端产生了如此高的错误率。

    使用特征重要性

    • 您消除了连续的最不重要的功能,导致事实上,在连续树上,根本不会考虑该功能(因此在特征重要性发生的任何错误的可能性较小)
    • 执行此外,依次提高更加令人讨厌的特征的机会再次选择,再次拆分,因此误差余量比较不少于

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2023-03-04
      • 1970-01-01
      • 2019-09-07
      • 2017-08-14
      • 1970-01-01
      • 2021-03-26
      • 1970-01-01
      相关资源
      最近更新 更多