【问题标题】:Dimension Reduction in Categorical Data with missing values具有缺失值的分类数据中的降维
【发布时间】:2011-02-19 17:44:03
【问题描述】:

我有一个回归模型,其中因变量是连续的,但 90% 的自变量是分类变量(有序和无序),大约 30% 的记录有缺失值(更糟糕的是,它们随机缺失任何模式,也就是说,超过 45% 的数据至少有一个缺失值)。没有先验理论来选择模型的规格,因此关键任务之一是在运行回归之前进行降维。虽然我知道连续变量降维的几种方法,但我不知道分类数据的类似静态文献(也许除了作为对应分析的一部分,它基本上是频率表上主成分分析的变体)。我还要补充一点,数据集的大小适中,有 500000 个观测值,有 200 个变量。我有两个问题。

  1. 对于分类数据的降维以及稳健的插补(我认为第一个问题是插补,然后是降维),是否有很好的统计参考?
  2. 这与上述问题的实现有关。我之前已经广泛使用 R,并且倾向于大量使用 transcan 和 impute 函数来处理连续变量,并使用树方法的变体来估算分类值。我对 Python 有一定的了解,所以如果有什么好的东西可以用于这个目的,那么我会使用它。 python 或 R 中的任何实现指针都会有很大帮助。 谢谢。

【问题讨论】:

    标签: python r statistics


    【解决方案1】:

    关于分类数据的插补,我建议检查mice 包。另请查看presentation,它解释了它如何估算多元分类数据。另一个用于不完整多元数据的多重插补的软件包是Amelia。 Amelia 包含一些有限的能力来处理序数和名义变量。

    至于分类数据的降维(即一种将变量排列到同质集群中的方法),我建议使用Multiple Correspondence Analysis 的方法,该方法将为您提供最大化集群同质性的潜在变量。与主成分分析 (PCA) 和因子分析中所做的类似,MCA 解决方案也可以旋转以增加组件的简单性。旋转背后的想法是找到与旋转分量更清晰一致的变量子集。这意味着最大化组件的简单性有助于因子解释和变量聚类。在 R 中,MCA 方法包含在包 ade4MASSFactoMineRca(至少)中。至于 FactoMineR,如果将其作为额外菜单添加到 Rcmdr 包已经提出的菜单中,则可以通过图形界面使用它,安装 RcmdrPlugin.FactoMineR

    【讨论】:

    • 谢谢。这真的很有帮助。
    • 您好,现在找不到演示文稿的链接。
    • mice 包现在是 404
    • @Srinath Ganesh 已更正
    【解决方案2】:

    你说,45% 的数据至少有一个缺失值。这令人印象深刻。如果没有模式,我会先看看。你说他们是随机失踪的。你测试过 MAR 吗?您是否针对子组进行了 MAR 测试?

    不知道你的数据我会先看看是否没有很多缺失值的案例,看看是否有理论上或实际的理由来排除它们。实际原因是数据的产生。可能是他们没有被很好地观察,产生数据的机器没有一直转动,调查没有一直覆盖所有国家等等。例如,你有当前职业的调查数据,但部分受访者已退休。所以他们必须(系统)失踪。您不能用某些计算值替换这些数据。

    也许您可以从完整的案例中切出切片并寻找数据产生的条件。

    【讨论】:

      猜你喜欢
      • 2020-11-25
      • 2020-02-29
      • 1970-01-01
      • 1970-01-01
      • 2018-02-17
      • 2016-06-11
      • 1970-01-01
      • 2016-11-15
      • 2015-10-29
      相关资源
      最近更新 更多