【发布时间】:2017-07-17 08:56:39
【问题描述】:
我们通常对标称数据进行one-hot编码,以便更合理地计算特征之间的距离或权重,但我经常听说基于树的像随机森林或boosting模型这样的模型不需要做one-hot encoding,但是我在网上搜索了并且不知道,谁能告诉我为什么或指导我一些材料来弄清楚吗?
【问题讨论】:
标签: machine-learning model random-forest one-hot-encoding boosting
我们通常对标称数据进行one-hot编码,以便更合理地计算特征之间的距离或权重,但我经常听说基于树的像随机森林或boosting模型这样的模型不需要做one-hot encoding,但是我在网上搜索了并且不知道,谁能告诉我为什么或指导我一些材料来弄清楚吗?
【问题讨论】:
标签: machine-learning model random-forest one-hot-encoding boosting
但我经常听到基于树的模型,例如随机森林或提升 模型不需要做one-hot编码
这不一定正确,因为某些实现会对数值和分类变量应用不同的逻辑,因此最好为您使用的库适当地编码分类变量。
但是,有时可能对决策树模型使用数字编码,因为它们只是在寻找分割数据的位置,而不是将输入乘以权重。将此与将red=1, blue=2 解释为蓝色是两倍红色的神经网络进行对比,这显然不是你想要的。
【讨论】: