【问题标题】:Use of one-hot encoder to build decision trees使用 one-hot 编码器构建决策树
【发布时间】:2018-06-27 13:56:31
【问题描述】:

我需要根据分类数据构建决策树。 我知道 scikit-learn 只能处理数值,因此推荐的方法是使用热编码,最好使用 Panda Dummies。

因此,我构建了一个示例数据集,其中所有属性和标签都是分类的。在这个阶段,我试图了解如何“one-hot”编码以便能够使用 sklearn,但文档没有解决这种情况。

最终能给我一个简单的例子或一些初学者材料的链接吗?

【问题讨论】:

    标签: python-3.x decision-tree one-hot-encoding


    【解决方案1】:

    根据我的测试,One-hot 编码导致连续变量(在我的情况下为数量)被赋予了更高的特征重要性。

    此外,分类变量的单个级别必须满足非常高的标准才能在树构建的早期被选中进行拆分。这显然会降低预测性能(不幸的是,我没有在任何帖子中看到这个结果)。

    我将研究其他方法。

    【讨论】:

      猜你喜欢
      • 2017-02-24
      • 2020-09-18
      • 2019-07-11
      • 2019-06-28
      • 2016-07-27
      • 2018-09-11
      • 1970-01-01
      • 2021-12-13
      • 2017-06-21
      相关资源
      最近更新 更多