【发布时间】:2019-02-25 15:49:56
【问题描述】:
问题的症结在于如何将一个列变量传入一个分组的df中,以有条件地求和数据。示例数据如下:
library(dplyr)
library(rlang)
set.seed(1)
# dummy dates
date_vars <- purrr::map(c('2018-01-31', '2018-02-28', '2018-03-31',
'2018-04-30', '2018-05-31', '2018-06-30',
'2018-07-31', '2018-08-31', '2018-09-30',
'2018-10-31', '2018-11-30', '2018-12-31'), as.Date) %>%
purrr::reduce(c)
dummy_df <- tibble(
id = rep(c("a", "b", "c"), each = 12),
date = rep(date_vars, 3),
value = runif(36, 1, 10)
)
下面的函数将获取一个数据框,按变量分组(使用 rlang 的 sym 函数),然后通过添加日期大于或等于某个日期期间的所有值来创建一个新的汇总列。在这里,我总结了 3 个月的“价值”。
agg_by_period <- function(df, date_period, period, grouping, new_col_prefix){
grouping_vars <- syms(grouping)
new_sum_column <- quo_name(paste0(new_col_prefix, "sum_", period, 'm'))
df %>%
group_by(!!!grouping_vars) %>%
summarize(!!new_sum_column := sum(value[date >= date_period], na.rm = T)) %>%
select(!!!grouping_vars, !!sym(new_sum_column))
}
agg_by_period(df = dummy_df,
date_period = as.Date('2018-10-31'),
grouping = 'id',
period = 3,
new_col_prefix = 'new_'
)
# A tibble: 3 x 2
id new_sum_3m
<chr> <dbl>
1 a 7.00
2 b 11.9
3 c 18.1
太棒了!我的问题是特定于当此列被命名为“值”以外的其他名称时使函数中的“值”动态化。我天真地尝试使用 sym() 传入此列,其错误如下:
agg_by_period2 <- function(df, date_period, period, grouping, new_col_prefix,
value_var){
grouping_vars <- syms(grouping)
new_sum_column = quo_name(paste0(new_col_prefix, "sum_", period, 'm'))
value_var_col <- sym(value_var)
df %>%
group_by(!!!grouping_vars) %>%
summarize(!!new_sum_column := sum(!!value_var_col[date >= date_period], na.rm = T)) %>%
select(!!!grouping_vars, !!sym(new_sum_column))
}
agg_by_period2(df = dummy_df,
date_period = as.Date('2018-10-31'),
grouping = 'id',
period = 3,
new_col_prefix = 'new_',
value_var = 'value'
)
Error in `>=.default`(date, date_period) :
comparison (5) is possible only for atomic and list types
上述函数在删除日期条件([date >= date_period])时有效。任何帮助将不胜感激。
【问题讨论】:
-
嗯,不太熟悉使用
sym或syms。你检查过这个吗? dplyr.tidyverse.org/articles/programming.html