【发布时间】:2011-02-19 17:44:03
【问题描述】:
我有一个回归模型,其中因变量是连续的,但 90% 的自变量是分类变量(有序和无序),大约 30% 的记录有缺失值(更糟糕的是,它们随机缺失任何模式,也就是说,超过 45% 的数据至少有一个缺失值)。没有先验理论来选择模型的规格,因此关键任务之一是在运行回归之前进行降维。虽然我知道连续变量降维的几种方法,但我不知道分类数据的类似静态文献(也许除了作为对应分析的一部分,它基本上是频率表上主成分分析的变体)。我还要补充一点,数据集的大小适中,有 500000 个观测值,有 200 个变量。我有两个问题。
- 对于分类数据的降维以及稳健的插补(我认为第一个问题是插补,然后是降维),是否有很好的统计参考?
- 这与上述问题的实现有关。我之前已经广泛使用 R,并且倾向于大量使用 transcan 和 impute 函数来处理连续变量,并使用树方法的变体来估算分类值。我对 Python 有一定的了解,所以如果有什么好的东西可以用于这个目的,那么我会使用它。 python 或 R 中的任何实现指针都会有很大帮助。 谢谢。
【问题讨论】:
标签: python r statistics