【问题标题】:Best way to deal with categorical variables in regression problem - python处理回归问题中分类变量的最佳方法 - python
【发布时间】:2020-08-30 15:28:12
【问题描述】:

我不确定在回归问题中处理分类变量的最有效方法是什么。

我的桌子看起来像:

Date        Category    Sales

1/1/2018     Shoes       200

1/2/2018     Shoes       300

1/1/2018     home        100

我正在处理的问题是销售预测。

处理“类别”列的最佳方法是什么?得到假人或标签编码器? 我使用了标签编码器,然后是标准缩放器,但我的拟合效果很差。 之后,我缩放了所有输入(date, category),y variable (Sales). 除外

【问题讨论】:

  • 假人/标签编码器是常用的方式
  • One-Hot Encoding 是一种解决方案。
  • 您不应该使用 LabelEncoder。见LabelEncoder for categorical features?。您应该使用 OneHot 编码器,或者如果基数很大,您可以查看贝叶斯编码器。见this other answer

标签: python pandas machine-learning regression


【解决方案1】:

不推荐使用标签编码器。

如果数据的基数很高,则进行目标编码,否则您可以尝试单热编码和目标编码。

使用目标编码进行时间序列预测的示例笔记本:https://www.kaggle.com/avvinci/time-series-forecasting-beginners [单元格 21]

有关目标编码的更多信息:https://maxhalford.github.io/blog/target-encoding/

这里有关于分类变量的好教程:https://www.coursera.org/learn/competitive-data-science#syllabus [部分:关于模型的特征预处理和生成,第三个视频]

【讨论】:

    猜你喜欢
    • 2020-10-18
    • 2017-04-26
    • 2010-12-19
    • 2019-04-25
    • 2020-01-14
    • 1970-01-01
    • 2017-08-11
    • 1970-01-01
    • 2015-03-29
    相关资源
    最近更新 更多