【发布时间】:2019-08-12 21:53:55
【问题描述】:
我想对我的数据行进行子集化
library(data.table); set.seed(333); n <- 100
dat <- data.table(id=1:n, group=rep(1:2,each=n/2), x=runif(n,100,120), y=runif(n,200,220), z=runif(n,300,320))
> head(dat)
id group x y z
1: 1 1 109.3400 208.6732 308.7595
2: 2 1 101.6920 201.0989 310.1080
3: 3 1 119.4697 217.8550 313.9384
4: 4 1 111.4261 205.2945 317.3651
5: 5 1 100.4024 212.2826 305.1375
6: 6 1 114.4711 203.6988 319.4913
在每个组内的几个阶段。我需要自动执行此操作,并且子集可能为空。例如,只关注第 1 组,
dat1 <- dat[1:50]
> s <-subset(dat1,x>119)
> s
id group x y z
1: 3 1 119.4697 217.8550 313.9384
2: 50 1 119.2519 214.2517 318.8567
第二步subset(s, y>219) 会空出来,但我仍然想应用第三步subset(s,z>315)。如果我要手动设置阈值,Frank 提供了一个出色的解决方案here 输出
> f(dat1, x>119, y>219, z>315)
cond skip
1: x > 119 FALSE
2: y > 219 TRUE
3: z > 315 FALSE
id group x y z
1: 50 1 119.2519 214.2517 318.8567
并报告跳过了哪些部分。
我的问题是我需要同时将其应用于不同的组,其中每个组的阈值在单独的 data.table 中给出。目标是每组至少有一个id。例如,如果我的阈值是
c <- data.table(group=1:2, x=c(119,119), y=c(219,219), z=c(315,319))
> c
group x y z
1: 1 119 219 315
2: 2 119 219 319
我想结束
> res
id group x y z
1: 50 1 119.2519 214.2517 318.8567
2: 55 2 119.2634 219.0044 315.6556
我可以在 for 循环中重复应用 Frank 的函数,但我确信有更聪明的方法可以节省时间。例如,我想知道该函数是否可以应用于 data.table 中的每个组。或者也许在 tidyverse 中有一种方法,我还不太熟悉。
【问题讨论】:
标签: r data.table subset tidyverse