【发布时间】:2016-08-06 17:10:59
【问题描述】:
另一个绊脚石。我有一大组数据(称为“明亮”),大约有 180k 行和 165 列。我正在尝试在 R 中创建这些列的相关矩阵。
出现了几个问题,我无法通过本网站和其他网站上提出的建议来解决这些问题。
首先,我是如何创建数据集的:我将它保存为 Excel 中的 CSV 文件。我的理解是 CSV 应该删除任何格式,这样任何数字都应该被 R 读取为数字。我用
加载它brightly = read.csv("brightly.csv", header=TRUE)
但我每次运行 cor(明亮地)时都会收到“'x' must be numeric”错误消息,所以我用 0 替换了所有 NA。 (这可能会改变我的数据,但我认为没关系——任何“NA”实际上都是 0,无论是对于连续变量还是虚拟变量。)
现在我不再收到有关文本的错误消息。但是任何时候我运行 cor()——同时对所有变量或变量组合运行——我都会收到“警告消息: 在 cor(brightly$PPV, brightly, 使用 = "complete") : 标准差为零”
我还发现一个变量与其他变量的一些相关性显示为“NA”。我已经确保数据中没有单元格是“NA”,所以我不知道为什么我会得到相关性的“NA”值。
我还尝试了以下两种方法,以确保我没有包含任何 NA 值:
cor(brightly$PPV, Brightly, use = "pairwise.complete.obs")
和
cor(brightly$PPV,brightly,use="complete")
但我仍然收到有关 SD 为零的警告,并且我仍然收到 NA。
关于为什么会发生这种情况的任何见解?
最后,当我尝试进行 corrplot 以 显示 相关性的结果时,我执行以下操作:
brightly2 1 + .Machine$double.eps) { 中的错误: 需要 TRUE/FALSE 的缺失值
我没有制作漂亮的颜色编码相关矩阵,而是得到了这个。我还没有找到解释这意味着什么。
任何帮助将不胜感激!非常感谢!!
【问题讨论】:
-
以
brightly的形式读入您的数据,并将str(brightly)的输出粘贴到您的问题中,无论是否包含NA。 -
只是澄清一下——在我上面“明亮”的所有地方,你想让我改用“str(brightly)”,在 R 中运行相同的代码,然后将输出粘贴到这里?绝对可以,只是想确保我在做正确的事。谢谢!
-
我建议您在记事本中打开 csv 文件并查看您的数字列。列是否包含带逗号的数字?
标签: r excel csv r-corrplot