【发布时间】:2017-11-19 10:13:12
【问题描述】:
我有一个这种类型的数据集。
Ingredient_A | Ingredient_B | Ingredient_C | Ingredient_D | Meal
------------------------------------------------------------------
Bread | Butter | - | - | buttered bread
Avocado | Tomato | Garlic | - | Guacamloe
我想用它训练一个 sklearn 决策树分类器,但我不知道如何处理我的数据集的不同特征维度。理想情况下,我希望忽略空单元格。我想过用 nan 替换空单元格,但 sklearn 不接受 nan 的。有没有办法在 sklearn 中使用这样的数据集?
【问题讨论】:
-
我相信你可以为此目的使用稀疏矩阵
标签: python machine-learning scikit-learn classification supervised-learning