【问题标题】:Create new column based on condition that exists within a rolling date根据滚动日期内存在的条件创建新列
【发布时间】:2015-01-28 04:35:20
【问题描述】:

为了使这个问题更笼统,我相信它也可以改写为:创建一个滚动的时间敏感因子变量。虽然这是一个不常见的要求,但这可以用于许多不同的数据源。

我有一系列non-uniform time data,每天有超过 1 条记录,供成千上万的用户使用。我想创建一个新列 player_type 来跟踪他们行为的滚动 30 天定义。行为由他们玩的游戏定义; 'games' 列是gameA、gameB的一个因子。

因此存在三种类型的行为:

  1. 独家玩游戏A - 'A'
  2. 独家玩GameB - 'B'
  3. 玩两个游戏 - 'Hybrid'

我想使用这个新列来查看他们的游戏行为随时间的变化,以及计算每个组中的玩家数量,看看他们是如何变化的。

每个玩家的时间序列非常不规则。玩家可以每天玩多种类型的游戏,或者几个月不玩任何游戏。每个玩家的时间序列是不规则的,因此只有在玩家玩游戏时才会创建记录,因此我希望解决方案可能会使用类似以下的过滤器:

interval(current_date, current_date - new_period(days=30)(使用润滑脂)。

这是一个示例数据集。请记住,这是简化并测试滚动 1 天的更改,因此之前检查记录的简单方法实际上不起作用。 如果你能做出更好的数据集,请指教,我会编辑这篇文章。

p <- c( 1,   1,   1,   2,   2,   2,   6,   6,   6)

g <- c('A', 'B', 'B', 'A', 'B', 'A', 'A', 'B', 'B')

d <- seq(as.Date('2014-10-01'), as.Date('2014-10-9'), by=1)

df <- data.frame(player_id = p, date = d, games = g)

作为我需要的输出:

 player_id       date games   type
1         1 2014-10-01     A      A (OR NA)
2         1 2014-10-02     B Hybrid
3         1 2014-10-03     B      B
4         2 2014-10-04     A      A (OR NA)
5         2 2014-10-05     B Hybrid
6         2 2014-10-06     A Hybrid
7         6 2014-10-07     A      A (OR NA)
8         6 2014-10-08     B Hybrid
9         6 2014-10-09     B      B

解决方案应该类似于,apply 通过列,并应用一个检查 30 天时间的函数,以及一个 ifelse() 语句来查看他们玩了哪些游戏。

这是一个非常相似的帖子 - 应该有助于解决这个问题。 How do I do a conditional sum which only looks between certain date criteria

我也使用 dplyr 探索了rowwise() 和有条件的mutates(),但问题是我的历史时间组件。

感谢大家的帮助!我不能感谢这个论坛。我会经常回来查看的。

【问题讨论】:

  • 在您的真实数据中,您是否需要检查每一行、所有前 30 行,或者您是否需要检查前一行(如本例所示)但行之间的增量将始终30天?
  • 我需要检查前 30 天(按玩家)。这可能是很多行,或者少于 30 行。行之间的增量不一致。 他们可以在同一天玩两场比赛,也可以几个月不玩任何一场比赛。

标签: r conditional data.table dplyr date-range


【解决方案1】:

假设我理解正确,这是使用foverlaps() 函数的data.table 方式。

创建dt并设置key如下图:

dt <- data.table(player_id = p, games = g, date = d, end_date = d)
setkey(dt, player_id, date, end_date)

hybrid_index <- function(dt, roll_days) {
    ivals = copy(dt)[, date := date-roll_days]
    olaps = foverlaps(ivals, dt, type="any", which=TRUE)
    olaps[, val := dt$games[xid] != dt$games[yid]]
    olaps[, any(val), by=xid][(V1), xid]
}

我们创建一个虚拟 data.table ivals(用于间隔),并且为每一行指定 startend 日期。请注意,通过将 end_date 指定为与​​ dt$end_date 相同,我们肯定会有一个匹配项(这是故意的) - 这将为您提供您要求的非 NA 版本。

[这里有一些小的改动,你可以得到NA 版本,但我会留给你(假设这个答案是正确的)。]

这样,我们只需找到ivalsdt 重叠的范围,对于每个 player_id。我们得到匹配的索引。从那里开始很简单。如果玩家的游戏是非同质的,那么我们从hybrid_index返回dt的对应索引。我们将这些索引替换为“混合”。

# roll days = 1L
dt[, type := games][hybrid_index(dt, 1L), type := "hybrid"]
#    player_id games       date   end_date   type
# 1:         1     A 2014-10-01 2014-10-01      A
# 2:         1     B 2014-10-02 2014-10-02 hybrid
# 3:         1     B 2014-10-03 2014-10-03      B
# 4:         2     A 2014-10-04 2014-10-04      A
# 5:         2     B 2014-10-05 2014-10-05 hybrid
# 6:         2     A 2014-10-06 2014-10-06 hybrid
# 7:         6     A 2014-10-07 2014-10-07      A
# 8:         6     B 2014-10-08 2014-10-08 hybrid
# 9:         6     B 2014-10-09 2014-10-09      B

# roll days = 2L
dt[, type := games][hybrid_index(dt, 2L), type := "hybrid"]
#    player_id games       date   end_date   type
# 1:         1     A 2014-10-01 2014-10-01      A
# 2:         1     B 2014-10-02 2014-10-02 hybrid
# 3:         1     B 2014-10-03 2014-10-03 hybrid
# 4:         2     A 2014-10-04 2014-10-04      A
# 5:         2     B 2014-10-05 2014-10-05 hybrid
# 6:         2     A 2014-10-06 2014-10-06 hybrid
# 7:         6     A 2014-10-07 2014-10-07      A
# 8:         6     B 2014-10-08 2014-10-08 hybrid
# 9:         6     B 2014-10-09 2014-10-09 hybrid

为了清楚地说明这个想法,我创建了一个函数并在函数内部复制了dt。但是您可以避免这种情况,将ivals 中的日期直接添加到dt,并在foverlaps() 中使用by.xby.y 参数。请看?foverlaps

【讨论】:

  • 这是梦幻般的。验证它正在处理我的真实数据。很有见地的回答。谢谢。
猜你喜欢
  • 2022-11-12
  • 1970-01-01
  • 1970-01-01
  • 2020-04-06
  • 2019-05-17
  • 1970-01-01
  • 2020-10-02
  • 1970-01-01
相关资源
最近更新 更多