【发布时间】:2020-01-04 21:07:58
【问题描述】:
我有一个数据框,其中包含一个整数类型的日期列。 我还想将价格划分在 10,000 范围内,然后计算该月的频率
> df
date values price
11/25/18 a 10000
11/30/18 b 30500
12/4/18 a 20000
12/5/18 b 65000
12/5/18 a 50000
12/6/18 b 35000
12/6/18 c 40000
12/6/18 a 45000
12/6/18 a 30000
12/7/18 b 80000
12/7/18 c 85000
12/7/18 a 90000
12/9/18 b 20000
12/12/18 a 32500
12/12/18 c 40200
12/13/18 b 56000
1/9/19 a 82000
1/9/19 c 63000
1/9/19 b 20000
1/10/19 d 25000
1/10/19 d 34000
1/10/19 d 13020
1/10/19 a 50000
1/11/19 c 24300
1/11/19 d 40000
2/1/19 a 95000
2/10/19 a 20000
2/13/19 b 10000
3/14/19 d 30000
3/17/19 c 45000
5/4/19 d 18000
5/5/19 c 12000
5/6/19 d 90000
5/31/19 a 90000
我正在尝试此代码,但我无法在一个月内进行汇总
df %>%
group_by(date) %>%
count(values)
由此,我得到了每天的频率
group_by(month = month(date)) %>%
count(values)
当我尝试使用此代码汇总月份日期时,出现以下错误
(as.POSIXlt.character(as.character(x), ...) 中的错误: 字符串不是标准的明确格式)
并以 10,000 步为一组(在价格列中)我正在使用以下代码
tally(group_by(df, values,
price = cut(price, breaks = seq(10000, 200000, by = 10000)))) %>%
ungroup() %>%
spread(price, n, fill = 0)
问题:
我无法将此与代码结合起来以汇总月份日期,然后按价格组分布数据。
预期输出:
date values 10k-20k 20k-30k 30k-40k 40k-50k 50k-60k 60k-70k 70k-80k 80k-90k
11/18 a 1
11/18 b 1
12/18 a 1 1 1 1 1
12/18 b 1 1 1 1
12/18 c 1 1 1
...
【问题讨论】: