【发布时间】:2015-09-01 09:04:16
【问题描述】:
我的数据由 50 列组成,其中大部分是字符串。我有一个必须预测的多类变量。我尝试在 scikit-learn 中使用 LabelEncoder 将特征(不是类)转换为整数并将它们作为输入提供给我正在使用的 RandomForest 模型。我正在使用 RandomForest 进行分类。
现在,当新的测试数据(新数据流)到来时,对于每一列,我怎么知道每个字符串的标签是什么,因为现在使用 LabelEncoder 会给我一个独立于我之前生成的标签的新标签.难道,我做错了吗?还有什么我应该使用的一致编码吗?
【问题讨论】:
标签: encoding machine-learning scikit-learn random-forest