【发布时间】:2018-12-16 14:04:18
【问题描述】:
我正在处理一个大型数据集(700 万行),试图了解各个自变量与因变量之间的相关性。当我运行 pcor(dataset) 时,如果在运行 cor(dataset) 时进行比较,则会产生更高的相关性。
我的数据集有 6 个因变量和 84 个自变量。我发现 每个 因变量以及 84 个独立变量的偏相关性。
我的自变量是文本类型(75 个类别)的字数,以及其他一些社会变量(所有数字)等性别。
我的问题是:我不确定为什么在 R 中使用 pcor() 时相关性很高,而使用 cor() 时相关性非常弱。这是偏相关的正常行为吗?
【问题讨论】:
-
pcor不是基本 R 函数。pcor属于哪个包,有什么作用? -
Google 告诉我
pcor是包ppcor、RVAideMemoire和ggm的一部分;你用的是哪一个?此外,在偏相关中,您正在测量两个变量之间的相关性,同时控制其他混杂变量。显然,这会给您带来与使用cor不同的结果。 -
相关性和部分相关性之间没有一般的顺序。举个例子
x=rnorm(10000)、y=rnorm(10000)和z=(x+y)/2。那么cor(x,y)几乎为零,而pcor(x,y|z)是正数。其他顺序也是可能的。 -
我在 R 中使用 ppcor 包
标签: r correlation pearson-correlation