【发布时间】:2015-06-20 07:02:12
【问题描述】:
我有一个这样的 csv 文件:
date,sym,close
2014.01.01,A,10
2014.01.02,A,11
2014.01.03,A,12
2014.01.04,A,13
2014.01.01,B,20
2014.01.02,B,22
2014.01.03,B,23
2014.01.01,C,33
2014.01.02,C,32
2014.01.03,C,31
然后,我通过read_csv 函数得到一个名为df 的日期框
import numpy as np
import pandas as pd
df=pd.read_csv('daily.csv',index_col=[0])
groups=df.groupby('sym')[['close']].apply(lambda x:func(x['close'].values))
groups 看起来像这样:
sym
A [nan,1.00,2.00,...]
B [nan,1.00,2.00,...]
C [nan,1.00,2.00,...]
如何计算每对sym之间的相关性?
AA,AB,AC,BB,BA,BC,CA,CB,CC
顺便说一句,每个符号的项目编号可能不相同。
【问题讨论】:
-
听起来你只想要 numpy
corrcoef()。如果这还不够,还可以将一个小型示例数据集(具有不同数量的项目)与您的代码一起发布。 -
@JohnE 我添加了一个示例数据集:)
-
sym 的个数约为 20。
-
您的样本数据可能需要修改为每个“符号”具有不同的日期(例如 2014.01.01,A,10, 2014.01.02,A,10, 2014.01.03,A,10 )
-
@Alexander 你是对的。我更改了日期。
标签: python pandas correlation