【发布时间】:2018-04-14 01:55:13
【问题描述】:
我的数据集包含一个数字特征和一个分类特征。它只有 20 个观察值(出于问题目的)。
X 是一个形状为 (20,1) 的 numpy 数组,类似于:
array([[10],
[465],
[3556],
[899],
[090],
....]]
encoded_x 是一个形状为 (20,4) 的 numpy 数组,类似于:
array([[ 0., 1., 0., 0.],
[ 1., 0., 0., 0.],
[ 0., 0., 1., 0.],
[ 0., 0., 1., 0.],
...................]]
问题:现在,如何合并这些数组以将它们作为 Xgboost 的输入?
最终的数组应该是什么样子?
我的理解是数字特征不应该被编码,这就是为什么我有两个不同的数组。
【问题讨论】:
-
如果这两个数组具有相同的行(它们可能应该),您可以使用numpy hstack。
标签: python arrays numpy xgboost one-hot-encoding