【问题标题】:How to create correlation using dplyr in R studio如何在 R studio 中使用 dplyr 创建相关性
【发布时间】:2017-05-10 06:16:09
【问题描述】:

我有一个数据集,其中包含 3 个属性(组织层次结构 region-area-territory,territory 是最低粒度)加上两个数字字段(sales qty 和 headcount)。

如何生成销售数量和地区人数之间的相关性,并按地区、地区和地区显示相关性?

我使用了 dplyr 包,g=group_by (mydataset, region, area, region),然后是 summarise(g, cor(sales_qty, headcount)。显示看起来正确,但所有相关性都是 'NA'。如果我省略领土,那么结果看起来是正确的(按区域和区域分组)。即使领土是最低级别,我仍然可以使用'group_by'功能吗?为什么显示NA?

感谢您的帮助!

【问题讨论】:

  • 什么是count(g)?计数列是 1 的列吗?

标签: r dplyr


【解决方案1】:

如果不查看您的代码,就很难判断您在尝试什么。我不能评论你做错了什么。这是我试图与组相关的内容。效果很好。

set.seed(1234)
df <- data.frame(group = rep(1:5, 100), x = rnorm(500) , y = rnorm(500) )
library(dplyr)

df %>% 
  group_by(group) %>% 
  do(data.frame(x=cor(.$x,.$y)))

输出:

 group             x
  <int>         <dbl>
1     1  0.1293551648
2     2  0.0006703073
3     3  0.2021294935
4     4 -0.0162522307
5     5  0.0995898089

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2018-06-11
    • 2012-05-27
    • 2016-02-20
    • 1970-01-01
    • 1970-01-01
    • 2019-09-14
    • 1970-01-01
    相关资源
    最近更新 更多