【发布时间】:2016-10-15 08:36:18
【问题描述】:
假设我有这个数据框
Date DayOfWeek Url Hits
09/01/2016 Thursday url1 3
09/01/2016 Thursday url2 5
09/01/2016 Thursday url3 4
09/02/2016 Friday url1 7
09/02/2016 Friday url3 6
09/03/2016 Saturday url2 9
09/03/2016 Saturday url1 5
09/04/2016 Sunday url2 6
09/07/2016 Wednesday url10 4
09/07/2016 Thursday url2 3
09/07/2016 Thursday url4 2
09/07/2016 Thursday url5 3
09/07/2016 Thursday url1 3
09/08/2016 Friday url1 3
09/08/2016 Friday url4 3
09/08/2016 Friday url5 2
09/08/2016 Friday url8 6
09/09/2016 Saturday url2 1
09/09/2016 Saturday url3 2
09/09/2016 Saturday url5 4
09/09/2016 Saturday url1 8
09/14/2016 Thursday url1 3
09/147/2016 Thursday url2 2
09/14/2016 Thursday url3 3
我想根据访问的唯一 url 的数量获得一周中最繁忙的一天。例如,在数据框中有 3 个星期四,第一个星期四访问了 3 个唯一 url,第二个星期四有 4 个,最后一个星期四有 3 个......我打算做的是,总 urls 的数量 = 3 + 4 + 3/ (# of thursdays = 3) = 当天唯一网址的平均数量....
对于星期五,第一个是 2 个 url,第二个是 4 个,计算将是 2 + 4 / 数据集中的星期五数 = 2
我正在尝试通过 dplyr 解决此问题。我正在尝试使用 group_by,但我似乎无法确定正确的功能组合来达到我的需要。
【问题讨论】: