【问题标题】:How can i select feature for a prediction model using caret for categorical variable?如何使用插入符号作为分类变量为预测模型选择特征?
【发布时间】:2019-10-31 20:16:20
【问题描述】:

我发现 R 中的 caret 包对于查看建模的重要性变量非常有帮助。但是,我的数据集中有所有分类变量,在这种情况下,'varImp' 命令返回因子变量的每个标签的变量重要性。我只想确定重要的不同变量列表,而不是标签。

library(caret)
logit <- glm(Life.Insurance.Owner~., data = train, family = 'binomial')
summary(logit)

varImp(logit,scale=FALSE)

【问题讨论】:

    标签: machine-learning data-science data-mining r-caret


    【解决方案1】:

    正如您提到的“数据集中的所有分类变量”.. 任何机会我都会看看变量。每个变量的水平大小是多少?

    有一种可能,您可以这样做 - 将分类变量转换为虚拟变量。现在你的数据集代表连续变量。 [但是,这同样取决于具体情况,并且 - 还要牢记您的目标。]

    创建虚拟变量的简单示例:

    x = c(红、蓝、绿)

    y = c(公共汽车、火车、船)

    x.dummy = model.matrix(~x - 1, data = x)

    y.dummy = model.matrix(~y - 1, data = y)

    【讨论】:

    • 谢谢。我的因变量是二元变量,自变量是分类变量。级别因变量而异,例如 2 到 7。
    • 如何分享数据结构并与您讨论问题?
    猜你喜欢
    • 2016-01-02
    • 2016-04-26
    • 2021-04-27
    • 2021-05-25
    • 1970-01-01
    • 1970-01-01
    • 2019-08-13
    • 2019-06-12
    • 2018-06-30
    相关资源
    最近更新 更多