【问题标题】:Which features to drop during feature selection在特征选择期间要删除哪些特征
【发布时间】:2020-09-04 03:54:31
【问题描述】:

在特征选择过程中(在进行了广泛的特征工程之后),是否有任何规则来管理哪些特征要删除和哪些要保留? 我知道应该删除高度相关的特征或将其合并到较新的特征中,但是我也看到人们丢弃与其他特征没有高度相关性但与目标变量具有显着更高相关性(> 0.8)的列。为什么呢 ? 任何其他提示和帮助表示赞赏。

附: : 我知道这个问题非常广泛,并不完全针对一个非常具体的主题。

【问题讨论】:

  • 我投票结束这个问题,因为它是题外话。请考虑CrossValidatedData Science。但是,我不会投票支持自动迁移,因为这个问题也太宽泛了。
  • 请从intro tour 重复on topichow to ask。最值得注意的是,我们希望您在此处发布问题之前进行适当的研究,并且您的核心问题已包含在相当多的在线资源中。另外,我删除了多余的“Python”标签和多余的“相关”标签。

标签: data-science feature-selection


【解决方案1】:

相对于您的 P.S.,我同意。这可能不是这个问题的正确论坛,如果您尝试不同的堆栈交换(例如理论计算机科学的堆栈交换),您可能会找到更全面/详细的回答:https://cstheory.stackexchange.com/

虽然我们在这里,但我不妨投入两分钱。就个人而言,当我进行特征选择时,我会丢弃与其他 IV/特征相关性低但与 DV/目标相关性高的特征,因为这是(多)共线性的指标,会对性能产生负面影响。这是进一步解释的链接:https://towardsdatascience.com/https-towardsdatascience-com-multicollinearity-how-does-it-create-a-problem-72956a49058

希望您能找到所需的内容,并祝您调优愉快!

【讨论】:

    猜你喜欢
    • 2022-11-20
    • 2021-09-07
    • 2017-12-02
    • 2019-08-13
    • 2013-02-21
    • 1970-01-01
    • 2011-01-10
    相关资源
    最近更新 更多