【问题标题】:separate a dataset into a regression group and a control group in R在 R 中将数据集分为回归组和对照组
【发布时间】:2016-04-17 06:33:11
【问题描述】:

这更有可能是一个设计问题。如果我计划运行回归 Y = X1 + X2 + X3 + X4 + X5,并且我的数据中有 X1 到 X10 以及 Y。将数据集分成回归样本和对照组的最佳方法是什么,以便我可以对回归样本运行回归并使用对照组验证我的模型?我应该只创建一个带有随机数的列并以这种方式分隔它们吗?谢谢。

【问题讨论】:

    标签: r controls regression logistic-regression bigdata


    【解决方案1】:

    如果您有一个名为 df 的数据框,其中包含一堆行和上述列,您可以按如下方式采样 n 行(本例中为 67%)并创建样本组和对照组:

    x <- sample(nrow(df), 0.67*nrow(df))
    sampledf <- df[x, ]
    controldf <- df[-x, ]
    

    如果您想重新排列行号,您可以像这样分配新的连续行号:

    row.names(sampledf) <- seq(1:nrow(sampled))
    row.names(controldf) <- seq(1:nrow(controldf))
    

    【讨论】:

      猜你喜欢
      • 2016-05-18
      • 2021-02-18
      • 2010-11-13
      • 2021-04-28
      • 2019-09-28
      • 2018-07-26
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多