【问题标题】:why tree-based model do not need one-hot encoding for nominal data?为什么基于树的模型不需要对标称数据进行 one-hot 编码?
【发布时间】:2017-07-17 08:56:39
【问题描述】:

我们通常对标称数据进行one-hot编码,以便更合理地计算特征之间的距离权重,但我经常听说基于树的像随机森林或boosting模型这样的模型不需要做one-hot encoding,但是我在网上搜索了并且不知道,谁能告诉我为什么或指导我一些材料来弄清楚吗?

【问题讨论】:

    标签: machine-learning model random-forest one-hot-encoding boosting


    【解决方案1】:

    但我经常听到基于树的模型,例如随机森林或提升 模型不需要做one-hot编码

    这不一定正确,因为某些实现会对数值和分类变量应用不同的逻辑,因此最好为您使用的库适当地编码分类变量。

    但是,有时可能对决策树模型使用数字编码,因为它们只是在寻找分割数据的位置,而不是将输入乘以权重。将此与将red=1, blue=2 解释为蓝色是两倍红色的神经网络进行对比,这显然不是你想要的。

    【讨论】:

    • 谢谢,你的例子给了我一些直觉,因为决策树只是通过检查特定输入值是否等于所选特征值来拆分样本,并且不使用该值来计算重量或距离
    猜你喜欢
    • 2020-11-04
    • 2018-10-14
    • 2021-10-21
    • 2019-10-11
    • 2018-05-22
    • 1970-01-01
    • 2011-01-10
    • 1970-01-01
    • 2017-11-06
    相关资源
    最近更新 更多