【问题标题】:How to train a sklearn classifier with a dataset that has varying feature dimension?如何使用具有不同特征维度的数据集训练 sklearn 分类器?
【发布时间】:2017-11-19 10:13:12
【问题描述】:

我有一个这种类型的数据集。

Ingredient_A | Ingredient_B | Ingredient_C | Ingredient_D | Meal
------------------------------------------------------------------
   Bread     |   Butter     |       -      |       -      | buttered bread
   Avocado   |   Tomato     |     Garlic   |       -      | Guacamloe

我想用它训练一个 sklearn 决策树分类器,但我不知道如何处理我的数据集的不同特征维度。理想情况下,我希望忽略空单元格。我想过用 nan 替换空单元格,但 sklearn 不接受 nan 的。有没有办法在 sklearn 中使用这样的数据集?

【问题讨论】:

  • 我相信你可以为此目的使用稀疏矩阵

标签: python machine-learning scikit-learn classification supervised-learning


【解决方案1】:

您应该将数据编码为如此vecors:

(Avocado, Bread, Butter, Garlic, Tomato)
(0,1,1,0,0) = 'Buttered Bread'
(1,0,0,1,1) = 'Guacamloe'

载体中的每个元素表示特定成分的存在。您可以将此格式的数据直接送入任何分类器,并且您不会有隐式排序的问题。

【讨论】:

    猜你喜欢
    • 2019-10-21
    • 2017-12-11
    • 2020-06-01
    • 2017-04-05
    • 2017-06-07
    • 2017-11-26
    • 1970-01-01
    • 2021-07-09
    • 1970-01-01
    相关资源
    最近更新 更多