【发布时间】:2020-02-08 16:23:30
【问题描述】:
这应该真的有效,但它没有,我失去了理智!
这是我的数据
> head(dataset_2,n=5)
CUSTOMER_NUMBER OLD_NEW_CLIENT COMPLETION_PRCT CRASH_RISK
1 535961675 Old client 0.06 25
2 223186690 Old client 0.04 24
3 217140964 Old client 0.05 32
4 514559839 Old client 0.10 52
5 10991413 Old client 0.53 15
> str(dataset_2)
'data.frame': 90405 obs. of 4 variables:
$ CUSTOMER_NUMBER: int 535961675 223186690 217140964 514559839 10991413 506839750 15102896 34980927 578647941 804552857 ...
$ OLD_NEW_CLIENT : chr "Old client" "Old client" "Old client" "Old client" ...
$ COMPLETION_PRCT: num 0.06 0.04 0.05 0.1 0.53 0.05 0.06 0.06 1 0.09 ...
$ CRASH_RISK : num 25 24 32 52 15 38 42 42 41 78 ...
- attr(*, ".internal.selfref")=<externalptr>
我想按所有其他列汇总客户数量 - 因此 old_new_client、completion_prct 和 crash_risk 的组合以及落入此存储桶的客户数量。但是当我输入代码时:
by_parameters <-dataset_2 %>%
group_by(OLD_NEW_CLIENT, COMPLETION_PRCT, CRASH_RISK) %>%
summarize(clients=n_distinct(CUSTOMER_NUMBER))
我明白了:
> by_parameters
clients
1 90399
感谢您的帮助!
【问题讨论】:
-
欢迎您!既然你弄清楚了这个问题,你能先解释一下哪里出了问题吗?在您的原始示例中,您使用的是
dplyr库吗?