【发布时间】:2017-05-10 06:16:09
【问题描述】:
我有一个数据集,其中包含 3 个属性(组织层次结构 region-area-territory,territory 是最低粒度)加上两个数字字段(sales qty 和 headcount)。
如何生成销售数量和地区人数之间的相关性,并按地区、地区和地区显示相关性?
我使用了 dplyr 包,g=group_by (mydataset, region, area, region),然后是 summarise(g, cor(sales_qty, headcount)。显示看起来正确,但所有相关性都是 'NA'。如果我省略领土,那么结果看起来是正确的(按区域和区域分组)。即使领土是最低级别,我仍然可以使用'group_by'功能吗?为什么显示NA?
感谢您的帮助!
【问题讨论】:
-
什么是
count(g)?计数列是 1 的列吗?