【发布时间】:2014-01-20 11:34:43
【问题描述】:
我在pandas 中有一个数据框,其中包含根据维基百科文章计算的指标。两个分类变量 nation 这篇文章是关于哪个国家的,lang 这是从维基百科的哪个语言中提取的。对于单个指标,我想看看国家和语言变量的相关性有多密切,我相信这是使用 Cramer 的统计数据完成的。
index qid subj nation lang metric value
5 Q3488399 economy cdi fr informativeness 0.787117
6 Q3488399 economy cdi fr referencerate 0.000945
7 Q3488399 economy cdi fr completeness 43.200000
8 Q3488399 economy cdi fr numheadings 11.000000
9 Q3488399 economy cdi fr articlelength 3176.000000
10 Q7195441 economy cdi en informativeness 0.626570
11 Q7195441 economy cdi en referencerate 0.008610
12 Q7195441 economy cdi en completeness 6.400000
13 Q7195441 economy cdi en numheadings 7.000000
14 Q7195441 economy cdi en articlelength 2323.000000
我想生成一个矩阵,显示所有国家组合(法国、美国、科特迪瓦和乌干达)['fra','usa','uga'] 和三种语言['fr','en','sw'] 之间的克莱默系数。所以会有一个 4 x 3 矩阵,如:
en fr sw
usa Cramer11 Cramer12 ...
fra Cramer21 Cramer22 ...
cdi ...
uga ...
最终,我将对我正在跟踪的所有不同指标进行此操作。
for subject in list_of_subjects:
for metric in list_of_metrics:
cramer_matrix(metric, df)
然后我可以检验我的假设,即语言为维基百科语言的文章的指标会更高。谢谢
【问题讨论】:
-
你解决了吗?
标签: python pandas statistics