【问题标题】:Example of aregImpute using group argument使用组参数的 aregImpute 示例
【发布时间】:2018-02-22 19:31:20
【问题描述】:

出于保密原因,我有一个无法发布的数据集。我试图在Hmisc 中使用aregImpute 来估算缺失值。但是,我收到类似这样的错误:

aregImpute() 中的错误:引导重新采样的以下变量的唯一值太少:... "VARIABLE" 具有以下水平,观察值

有人可以提供一个aregImpute 使用 group 参数的示例,以便我可以看到 group 参数在aregImpute 中是如何使用的?

我并没有真正遵循文档:https://www.rdocumentation.org/packages/Hmisc/versions/4.1-0/topics/aregImpute

【问题讨论】:

    标签: r hmisc


    【解决方案1】:

    您应该可以说group=data$variablename,其中variablename 是离散变量之一的名称。但在许多情况下,最好在一开始就折叠类别。

    【讨论】:

    • 这不起作用。我如何为多个变量更改它(因为我有多个返回此错误的变量)?此外,当我折叠具有 > 3 个级别的所有变量的类别时,我的协变量从 288 个增加到 800 个。因为我只有 700 个样本,所以我觉得这不是一个好主意。从机器学习的角度来看(例如,使用线性回归或带有此数据的决策树来预测结果),当样本与协变量的比率如此偏斜时,是否可以折叠变量?
    • 预测变量的数量、样本量、您要预测的结果变量的分布以及预测结果的候选参数总数是多少?请注意,折叠级别并不意味着完全删除协变量。 [group 方法仅适用于一个变量或极少数变量中的interaction()
    • 我认为折叠是采用任何离散变量并将它们分解为每种类型的二进制结果。例如,一个取 1-7 的 var X 将被折叠成 X1, X2,...X7 来判断 X 是否取值 1-7。像这样折叠会产生约 800 个协变量。我实际上有 288 个预测变量,780 个样本,不确定结果变量的分布(0-10 的连续值),以及技术上 288 个候选预测变量。抱歉,如果我不能很好地回答问题,我对此很陌生。
    • 我有几个变量出现这个错误。我是否应该删除那些我可以删除的变量,这些变量基于知识领域专家,似乎不是强预测变量?我开始一一删除出现此错误的变量,只是为了查看 aregImpute 是否运行,但发现更多变量出现该错误。
    • 折叠意味着不经常折叠的关卡。这不一定会导致二进制变量。更大的图景:您的样本量太小了大于 5 倍,无法满足您的工作方法。我会放弃这个问题或首先使用大量的无监督学习(数据减少对 Y 视而不见)。
    猜你喜欢
    • 2021-02-26
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-03-24
    • 2017-02-11
    • 1970-01-01
    • 2021-07-11
    • 1970-01-01
    相关资源
    最近更新 更多