【发布时间】:2021-05-07 20:13:56
【问题描述】:
我有以下数据框
我需要计算所有列的相关矩阵。问题是:当我分别计算两列时,我得到的值与我使用 df.corr() 为每一对一起计算时得到的值不同。
我构建数据框的方式是将第一列与其他每一列合并,这种合并过程导致了两乘两数据框的不同行长。
例如:第一列 (btc_logreturns) 和第二列 (gold_logreturns) 最初有 2000 行,而 btc_logreturns 和 ewz_logreturns 有 2100 行。但所有列加起来有 2459 行。
函数 .corr() 在计算相关性时是否考虑了 NaN?对于我得到的不同相关值,数据帧的长度是否是一个潜在问题?
【问题讨论】:
-
列对齐是否合适(连接后)?看起来您不使用日期时间索引,而只是使用常规整数。这可能会导致问题。
标签: python correlation