【问题标题】:How to choose best imputed data using mice如何使用鼠标选择最佳估算数据
【发布时间】:2017-09-14 18:49:13
【问题描述】:

使用mice 包我估算了一个数据集,例如:

imp <- mice(nhanes)

它为每个变量生成 5 个估算数据集:

imp$imp$bmi
#      1    2    3    4    5
#1  35.3 30.1 26.3 28.7 27.2
#3  30.1 22.0 30.1 28.7 22.0
#4  21.7 27.2 25.5 24.9 21.7
#6  24.9 25.5 24.9 27.5 22.5
#10 20.4 33.2 26.3 27.2 27.4
#11 22.0 27.2 27.2 30.1 22.0
#12 27.4 20.4 27.2 27.2 20.4
#16 30.1 30.1 27.2 22.5 29.6
#21 27.4 27.2 26.3 22.0 30.1

所以我不明白如何选择最好的估算数据。

例如对于 bmi(上图)5 列中的哪一个是最佳选择?

谢谢

【问题讨论】:

    标签: r r-mice


    【解决方案1】:

    没有最好的数据集。 选择单个数据集只会考虑数据集内的变化/错误,而不考虑插补数据集之间的变化。

    这就是为什么在处理估算数据时,回归等分析应该使用withpool 命令。

    【讨论】:

      【解决方案2】:

      老鼠的整个概念是你有多个估算数据集

      如果您只需要 1 个估算数据集,您可以使用 Single Imputation 包,例如 missForest、imputeR、VIM,这些包有时更易于使用/理解语法。

      像老鼠这样的Multiple Imputation包的优点是,您有多个插补数据集,这可以帮助解释执行插补时出现的不确定性。

      您不会使用其中一个估算数据集,而是对所有 5 个(或更多)这些数据集执行分析。

      通过这样做,您可以知道分析结果的差异有多大。之后,您可以汇总结果。 mice 可以帮助您完成这个过程。

      典型的鼠标工作流程如下所示:

      # 1. Perform imputations
      imp <- mice(nhanes, maxit = 2, m = 2)
      
      # 2. Create model for all imputed datasets / in this case m = 2
      fit <- with(data = imp, exp = lm(bmi ~ hyp + chl))
      
      # 3. Pool the results
      pool <- pool(fit)
      
      # Print results
      summary(pool)
      

      【讨论】:

        猜你喜欢
        • 2021-11-01
        • 1970-01-01
        • 1970-01-01
        • 2016-07-31
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2016-07-21
        相关资源
        最近更新 更多