【发布时间】:2020-08-30 15:28:12
【问题描述】:
我不确定在回归问题中处理分类变量的最有效方法是什么。
我的桌子看起来像:
Date Category Sales
1/1/2018 Shoes 200
1/2/2018 Shoes 300
1/1/2018 home 100
我正在处理的问题是销售预测。
处理“类别”列的最佳方法是什么?得到假人或标签编码器?
我使用了标签编码器,然后是标准缩放器,但我的拟合效果很差。
之后,我缩放了所有输入(date, category),y variable (Sales). 除外
【问题讨论】:
-
假人/标签编码器是常用的方式
-
One-Hot Encoding 是一种解决方案。
-
您不应该使用 LabelEncoder。见LabelEncoder for categorical features?。您应该使用 OneHot 编码器,或者如果基数很大,您可以查看贝叶斯编码器。见this other answer
标签: python pandas machine-learning regression