【发布时间】:2017-11-21 11:37:31
【问题描述】:
我有一个包含 20 多列的数据集,每列都有分类数据。如何在 python 中使用 sklearn 对那些进行编码。 LabelBinarizer、LabelEncoder、Onehotencoder 都试过了,还是不行。
其中一个错误:
ValueError:标签二值化不支持多输出目标数据
我正在使用 kaggle 数据集
datasets = pd.read_csv('mushrooms.csv')
x = datasets.iloc[:, 1:23].values
y = datasets.iloc[:,0].values
from sklearn.model_selection import train_test_split
x_train,x_test,y_train,y_test = train_test_split(x,y,test_size=0.2,random_state=0)
from sklearn.preprocessing import LabelBinarizer
encoder = LabelBinarizer()
datasets_cat_hot = encoder.fit_transform(x_train)
【问题讨论】:
标签: python