【发布时间】:2021-01-01 04:23:31
【问题描述】:
在我的情况下,我想在我的数据集中编码大约 5 个不同的列,但问题是这 5 个列有许多唯一值。
如果我使用标签编码器对它们进行编码,我会添加一个不正确的不必要的顺序,而如果我使用 OHE 或 pd.get_dummies,那么我最终会得到很多特征,这些特征会增加数据的稀疏性。
我目前正在处理一个监督学习问题,以下是每列的唯一值:
Job_Role : Unique categorical values = 29
Country : Unique categorical values = 12
State : Unique categorical values = 14
Segment : Unique categorical values = 12
Unit : Unique categorical values = 10
我已经查看了多个参考资料,但不确定最佳方法。在这种情况下,应该怎样才能使对我的模型产生最大积极影响的特征数量最少
【问题讨论】:
标签: python-3.x pandas encoding scikit-learn categorical-data