【发布时间】:2018-06-28 10:29:52
【问题描述】:
我正在尝试解决由于数据量大而出现的问题并且我无法找到答案。 (即Data.table: how to get the blazingly fast subsets it promises and apply to a second data.table)
这是虚拟数据。
library(dplyr)
library(tidyr)
library(lubridate)
library(data.table)
adherence <- cbind.data.frame(c("1", "2", "3", "1", "2", "3"), c("2013-01-01", "2013-01-01", "2013-01-01", "2013-02-01", "2013-02-01", "2013-02-01"))
names(adherence)[1] <- "ID"
names(adherence)[2] <- "year"
adherence$year <- ymd(adherence$year)
lsr <- cbind.data.frame(
c("1", "1", "1", "2", "2", "2", "3", "3"), #ID
c("2012-03-01", "2012-08-02", "2013-01-06","2012-08-25", "2013-03-22", "2013-09-15", "2011-01-01", "2013-01-05"), #eksd
c("60", "90", "90", "60", "120", "60", "30", "90") # DDD
)
names(lsr)[1] <- "ID"
names(lsr)[2] <- "eksd"
names(lsr)[3] <- "DDD"
lsr$eksd <- as.Date((lsr$eksd))
lsr$DDD <- as.numeric(as.character(lsr$DDD))
lsr$ENDDATE <- lsr$eksd + lsr$DDD
lsr <- as.data.table(lsr)
adherence <- as.data.table(adherence)
我尝试了不同的方法来实现结果:笛卡尔连接给了我超过 2*31 的行并且不起作用。我重写了 data.table 中的所有内容,它实际上将运行速度降低了几天。我发现如果我可以让这条线返回所需的结果,我可以创建一个 for 循环,查看“2013-02-01”和 500 个其他时间点并实现我的梦想(继续另一个问题)。下面的一个子集只需要 15 秒处理我的数据(所以我可以在几个小时内运行它),但我的问题是它只返回具有值子集的组。 ID:2 没有返回,我认为,因为该组在 i 中没有匹配项。 - 减少花在操作上的时间。
lsr[eksd <= as.Date("2013-02-01") & ENDDATE > as.Date("2013-02-01"), sum(as.numeric(ENDDATE - as.Date("2013-02-01"))), keyby = ID]
ID V1
1: 1 64
2: 3 63
在大多数情况下这很聪明,但我需要有关长度 = 0 的组的信息。(或任何值 - 我只需要不删除 ID 信息)。有点像这样:
ID V1
1: 1 64
2: 2 0
3: 3 63
我尝试使用 tidyr::complete 函数(如下所述:dplyr summarise: Equivalent of ".drop=FALSE" to keep groups with zero length in output),但 dplyr 太慢了。我的 0.2% 的数据需要 7 个小时。我相信这可以以某种方式实现。欢迎和赞赏任何建议。
【问题讨论】:
-
您的数据有多大?
-
@MichaelChirico - "Somehow like this:" 之后的三行表
-
@minem 我的 lsr 有 20 mio 行和 12 列,我试图不使用的粘附数据集有 1,5 mio 行,每行 2 列。
标签: r data.table grouping subset