【发布时间】:2020-10-13 09:06:16
【问题描述】:
我有一个包含多个需要标签编码的列的数据框。 问题是测试组将来可能包含看不见的数据(类)。 我希望将这些类标记为它们自己的组,以便在我预测新数据集时代码不会崩溃。
我尝试使用 sklearn labelencoder 但收到了。
ValueError: y contains previously unseen labels: 'rat'
我还需要可重复使用的编码器,这意味着我将能够使用相同的值对未来的数据集进行编码。
有没有办法做到这一点?
【问题讨论】:
-
试试 skutils 的 safelabelencoder :tgsmith61591.github.io/skutil/_modules/skutil/preprocessing/… - 它将看不见的值填充为 999999
标签: python machine-learning xgboost