【问题标题】:Cumsum table with grouping带分组的 Cumsum 表
【发布时间】:2017-11-09 02:00:14
【问题描述】:

如何获取按性别和州分组的 Cumsum 表?

Gender = sample(c('male', 'female'), 100, replace=TRUE)
State = sample(c('CA', 'WA', 'NV', 'OR', "AZ"), 100, replace=TRUE)
Number = sample(1:8, size=100, replace=TRUE)

df <- data.frame(Gender,State, Number)

【问题讨论】:

  • 试试library(dplyr);df %&gt;% group_by(Gender, State) %&gt;% mutate(Number = cumsum(Number)) 不确定输出虽然
  • 这是一个脏表名
  • 什么是“Cumsum 表”?我们都只是猜测您想要输出什么。

标签: r cumsum


【解决方案1】:

如果我们正在寻找 cumsum 表,那么

library(data.table)
dcast(setDT(df)[, .N, .(Gender, State, Number)
      ][, perc := round(100*N/sum(N), 2), .(Gender, State)],
     Gender + State ~Number, value.var = 'perc', fill = 0, drop = FALSE)[, 
     (3:10) := lapply(Reduce(`+`, .SD, accumulate = TRUE),
            function(x) paste0(x, "%")), .SDcols = -(1:2)][]

【讨论】:

  • 这正是我要找的!哇..代码比我想象的要复杂。感谢您的时间和精力!
【解决方案2】:

对于更简单的方法,我建议使用 dplyr。当您加载 tidyverse 时,Dplyr 会与许多其他有用的软件包一起加载。

library(tidyverse)

Gender = sample(c('male', 'female'), 100, replace=TRUE)
State = sample(c('CA', 'WA', 'NV', 'OR', "AZ"), 100, replace=TRUE)
Number = sample(1:8, size=100, replace=TRUE)

df <- data.frame(Gender,State, Number)

df <- df %>% 
  group_by(Gender, State) %>% 
  mutate(Number_CumSum = cumsum(Number)) %>% 
  ungroup() %>% 
  arrange(State, Gender)

head(df)

# A tibble: 6 x 4
  Gender  State Number Number_CumSum
  <fctr> <fctr>  <int>         <int>
1 female     AZ      8             8
2 female     AZ      3            11
3 female     AZ      4            15
4 female     AZ      5            20
5 female     AZ      2            22
6 female     AZ      7            29

【讨论】:

    猜你喜欢
    • 2022-01-18
    • 2017-06-08
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-04-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多