【问题标题】:separate a dataset into a regression group and a control group in R在 R 中将数据集分为回归组和对照组
【发布时间】:2016-04-17 06:33:11
【问题描述】:
这更有可能是一个设计问题。如果我计划运行回归 Y = X1 + X2 + X3 + X4 + X5,并且我的数据中有 X1 到 X10 以及 Y。将数据集分成回归样本和对照组的最佳方法是什么,以便我可以对回归样本运行回归并使用对照组验证我的模型?我应该只创建一个带有随机数的列并以这种方式分隔它们吗?谢谢。
【问题讨论】:
标签:
r
controls
regression
logistic-regression
bigdata
【解决方案1】:
如果您有一个名为 df 的数据框,其中包含一堆行和上述列,您可以按如下方式采样 n 行(本例中为 67%)并创建样本组和对照组:
x <- sample(nrow(df), 0.67*nrow(df))
sampledf <- df[x, ]
controldf <- df[-x, ]
如果您想重新排列行号,您可以像这样分配新的连续行号:
row.names(sampledf) <- seq(1:nrow(sampled))
row.names(controldf) <- seq(1:nrow(controldf))