【发布时间】:2020-08-18 07:36:03
【问题描述】:
我真的在为分类类型编码而苦苦挣扎。给定两个 DataFrames X_train 和 X_test 我正在尝试对所有邮政编码进行编码。对我来说最大的障碍是能够以相同的方式对 both 数据帧中的值(因为它们在某种程度上有所不同)进行编码,所以我想列出所有可能的邮政编码值,然后使用它来编码两个系列(作为 DataFrames 的一部分)。不幸的是,这不起作用,因为出现了错误AttributeError: 'numpy.ndarray' object has no attribute 'transform'。我的想法不多了。
X_train = X[['ticket_id','judgment_amount','zip_code']]
X_test = y[['ticket_id','judgment_amount','zip_code']]
Xtrain_zipcode = X_train['zip_code'].dropna().unique().tolist()
Xtest_zipcode = X_test['zip_code'].dropna().unique().tolist()
zip_list = Xtrain_zip
for elem in Xtest_zipcode:
if elem not in Xtrain_zipcode:
zip_list.append(elem)
enc_zipc = LabelEncoder().fit(zip_list)
encoded = enc_zipc.transform(zip_list)
encoded.transform(X_train['zip_code'])
我也有read LabelEncoder 在处理作为输入的分类特征时是不可取的。你有什么建议?一键编码?
【问题讨论】: