【发布时间】:2016-05-08 15:03:13
【问题描述】:
我有以下类似于以下的数组(实际上是一个 Panda 数据帧,它具有类似数组的数据结构):
[
['M', 4, 15]
['M', 3, 7]
['F', 5, 9]
['I', 4, 15]
]
我希望对这些数据进行预处理,以便在线性回归中使用它。 我相信做到这一点的方法是使用一个热编码器:http://scikit-learn.org/stable/modules/generated/sklearn.preprocessing.OneHotEncoder.html#sklearn.preprocessing.OneHotEncoder。
但是,这仅在类别为整数时才有效。
我相信您可以使用 DictVectorizer: http://scikit-learn.org/stable/modules/generated/sklearn.feature_extraction.DictVectorizer.html#sklearn.feature_extraction.DictVectorizer 来做到这一点
但是,这似乎只适用于字典,而不是数组。
【问题讨论】:
标签: python machine-learning scikit-learn