【问题标题】:How to proceed with descriptive statistics (median, IQR, frequencies, proportions etc) after multiple imputation using MICE如何在使用 MICE 进行多重插补后进行描述性统计(中位数、IQR、频率、比例等)
【发布时间】:2021-03-30 10:25:39
【问题描述】:

我一直在使用 R 中的鼠标包 (van Buuren) 执行多重插补,m = 50(50 个插补数据集)和 20 次迭代,用于大约 9 个变量,缺失数据(MAR = 随机缺失)范围从 5 -13%。在此之后,我想继续为我的数据集估计描述性统计数据(即,不要只对描述性统计数据使用完整的案例分析,还要将结果与我的插补中的描述性统计数据进行比较)。所以我现在的问题是,如何进行。

我知道处理 MICE 数据的正确程序是:

  1. 通过 mouse 函数对缺失的数据进行插补,从而产生多个插补数据集(中类);
  2. 用 with() 函数在每个插补数据集上拟合感兴趣的模型(科学模型),得到 mira 类的对象;
  3. 将每个模型的估计值合并为一组估计值和标准误差,结果是 mipo 类的对象; 或者,通过 D1() 或 D3() 函数比较来自不同科学模型的汇总估计值。

我的问题是我不明白如何将这个理论应用于我的数据。我已经完成了:

#Load package:
library(mice)
library(dplyr)

#Perform imputation:
Imp_Data <- mice(MY_DATA, m=50, method = "pmm", maxit = 20, seed = 123)

#Make the imputed data in long format:
Imp_Data_Long <- complete(Imp_Data, action = "long", include = FALSE)

然后我假设此过程对于获取 BMI 变量的中位数是正确的,其中 .imp 变量是插补数据集的编号(即从 1 到 50):

BMI_Medians_50 <- Imp_Data_Long %>% group_by(.imp, Smoker) %>% summarise(Med_BMI = median(BMI))

BMI_Median_Pooled <- mean(BMI_Medians_50$Med_BMI)

我可能完全理解错了,但我非常努力地理解正确的过程,并在 StackOverflow 和 StatQuest 上发现了非常不同的过程。

【问题讨论】:

    标签: r imputation r-mice


    【解决方案1】:

    嗯,通常您会执行多重插补(与单次插补相比),因为您想考虑执行插补带来的不确定性。

    丢失的数据最终会丢失 - 我们只能估计真实数据的样子。通过多重插补,我们生成多个估计,真实数据可能是什么样子。我们的目标是对估算值的值进行概率分布。

    对于您的描述性统计数据,您不需要使用 rubins 规则进行池化(这些对于标准误差和线性模型的其他指标很重要)。您将分别计算每个 m = 50 个估算数据集的统计数据,并将它们与您所需的指标汇总/汇总。

    您要归档的内容是为您的读者提供有关插补带来的不确定性的信息。 (以及估算值最有可能在哪个范围内)

    例如,将平均值视为描述性统计数据。在这里你可以例如提供这些估算数据集的最低均值和最高均值。您可以提供这些均值的均值以及插补数据集均值的标准差。

    您的完整案例分析将只提供例如3.3 作为变量的平均值。但是,在您的 m=50 多个估算数据集中,可能相同的平均值变化很大,例如从 1.1 到 50.3。这可以为您提供有价值的信息,即您应该非常小心地从完整的案例分析中获取 3.3,并且该数据集的此类统计数据通常存在很多不确定性。

    【讨论】:

    • 这正是我所需要的!与同一主题相关的问题:我想看看我的逻辑回归模型如何按性别、BMI 和年龄预测结果变量。我已经使用鼠标正确估算了 50 个数据集,现在我尝试弄清楚如何运行如下相应的命令(完整案例分析),但对于 50 个估算数据集。 Model1 &lt;- glm(Outcome ~ sex + Age + BMI, family = "binomial", data = MyData) 然后使用:roc(MyData$Outcome, Model1$fitted.values)。有什么具体的包或方法可以推荐吗?我一直找不到这样的中间对象!
    • 我不知道。您可能必须自己构建它。您需要对每个插补执行 ROC 分析。然后你要么绘制平均 ROC 面积(这对 m=50 有意义),要么将所有 ROC 曲线绘制到一个图中(信息丰富,但对于更高的 m 值不实用)。
    猜你喜欢
    • 1970-01-01
    • 2021-09-28
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-12-21
    • 2019-03-24
    • 1970-01-01
    相关资源
    最近更新 更多