【问题标题】:feeding categorical data to classifier将分类数据输入分类器
【发布时间】:2015-12-31 11:11:39
【问题描述】:

假设我有以下格式的数据集:

col1    col2     col3      col4         col5 (to be predicted)
12      13       4         primary      12 
1       15       2         secondary    13
5       7        8         primary      18
14      12       44        college      6

一些测试数据需要使用col1、col2、col3和col4来预测col5

在训练期间,可以将 col1、col2、col3 以数组形式提供给分类器,但如何提供 col4。 我知道这是分类的,需要转换为数字类型,但即使分配了一些数字,它仍将保持为名义类型。

所以如果primary=1、secondary=2 和college=3,则数字1,2 和3 无法根据大小进行比较,因为它们仍然像标签一样,没有数字意义。

那么在这一步之后我应该如何进行......它们应该被标准化吗?还是应该做进一步的事情?

【问题讨论】:

    标签: machine-learning dataset classification data-analysis categorical-data


    【解决方案1】:

    在这种情况下,您应该使用 One Hot Encoding。每个可能的分类值都会创建新的二元特征。

    One Hot Encoding for Machine learning

    【讨论】:

    • @Ologin 但如果分类特征的值的数量很大,那么我将不得不在数据集中添加那么多列。这不会增加分类器的复杂性吗?
    • 是的,你应该添加所有的二进制值,是的,它会增加分类器的复杂性,但如果你有足够的数据,这应该不是问题。此外,您可以以某种方式压缩特征空间,例如使用 FeatureHashing。
    猜你喜欢
    • 1970-01-01
    • 2020-09-20
    • 2018-03-09
    • 1970-01-01
    • 2021-03-27
    • 2013-08-06
    • 2019-02-14
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多