【发布时间】:2017-09-22 22:15:23
【问题描述】:
我有一组变量(大约 21 个),我想循环并为每个变量执行以下操作: 1. 分组为 10 组,按年份,分组由年度分布的十分位数确定 2. 根据这些新组计算均值(相等且加权)。
测试数据:
set.seed(4)
YR = data.table(yr=1962:2015)
ID = data.table(id=10001:11000)
DT <- YR[,as.list(ID), by = yr] # intentional cartesian join
rm("YR","ID")
# 54,000 obs now add data
DT[,`:=` (ratio = rep(sample(10),each=5400)+rnorm(nrow(DT)),
ratio2 = rep(sample(5),each=10800)+rnorm(nrow(DT)),
weight = abs(rnorm(nrow(DT)))*100,
val = rnorm(nrow(DT))
)]
DT
yr id ratio ratio2 weight val
1: 1962 10001 6.689275 4.895357 129.10487 -0.2022073
2: 1962 10002 4.718753 4.505419 140.70420 -0.0887587
3: 1962 10003 5.786855 4.359488 242.10988 0.9511465
4: 1962 10004 7.896540 4.049974 89.23235 -1.3822148
5: 1962 10005 7.776863 2.233036 177.79650 -1.0671091
---
53996: 2015 10996 10.613272 3.345091 153.81424 0.9269429
53997: 2015 10997 11.260932 1.804315 15.68129 -1.6618414
53998: 2015 10998 8.591909 3.332643 134.80929 -1.1632596
53999: 2015 10999 9.143039 3.012160 178.77301 -0.4761060
54000: 2015 11000 7.470945 4.068919 121.13470 -1.7594423
所以,我想循环遍历 ratio,然后是 ratio2 等,计算每一个的十分位数,然后通过每个新计算的十分位数来总结 val。请注意,这些不是编号变量,因此我无法使用 paste() 和 1:21 向量重新创建名称。 首先,我编写了这个函数来进行分组:
# [function] pctl.grp - order data into groups based on percentil breakpoints
# Number of groups passed
pctl.grp <- function(dat, grp) {
bp <- quantile(dat, probs = c(0,seq(100/grp,100,100/grp))/100)
cut(dat,bp,labels = FALSE, include.lowest = TRUE)
}
然后我可以像这样进行一次迭代:
# adds in new variable containing 10 groups numbered 1-10
DT[,ratiogrp := lapply(.SD, pctl.grp, 10), by = .(yr), .SDcols = c("ratio")]
DT[,.(ewval = mean(val),
ewratio = mean(ratio),
vwval = weighted.mean(val, weight, na.rm = TRUE),
vwratio = weighted.mean(ratio, weight, na.rm = TRUE)) ,by=ratiogrp][order(ratiogrp)]
这给出了预期的结果:
ratiogrp ewval ewratio vwval vwratio
1: 1 -0.027994385 3.576939 -0.039512050 3.572319
2: 2 -0.001146009 4.329835 0.005093692 4.331433
3: 3 -0.009087386 4.784103 -0.012764902 4.767494
4: 4 -0.014961467 5.094431 -0.015464918 5.110614
5: 5 0.014705294 5.373705 0.015276699 5.364962
6: 6 -0.010195630 5.645182 -0.014102394 5.618484
7: 7 0.001297953 5.949583 -0.012839401 5.925634
8: 8 -0.009300910 6.265297 -0.007141404 6.263371
9: 9 0.012970539 6.651047 0.018474949 6.684825
10: 10 0.003841495 7.363449 -0.004225650 7.351828
但是我如何在每个变量中循环 21 次呢?我可以像这样轻松获取变量的名称:
> grep(c("ratio"), names(DT))
[1] 3 4
> names(DT)[grep(c("ratio"), names(DT))]
[1] "ratio" "ratio2"
所以想想for (z in 1:length(namelist)) {} 或其他东西会起作用。但我不确定如何在 data.table 结构中引用这些名称(或数字)来重新创建我在上面所做的。
【问题讨论】:
标签: r loops data.table