【问题标题】:down sampling in r for regression (NOT classification)在 r 中下采样用于回归(非分类)
【发布时间】:2019-07-06 03:45:37
【问题描述】:

目前我正在简单地使用:

down_sample_size = 3000
train <- train[sample(nrow(train), down_sample_size),]

对我的训练数据进行下采样,以使我的模型拟合得更快(在超参数搜索和 CV 的背景下 - 上面已简化)。有没有更好的方法来做到这一点?例如,在分类的背景下,必须考虑类先验和分层。但是,也许以上对于回归是可以接受的?谢谢。

【问题讨论】:

  • 看看插入符号中的 downSample 函数,还有topepo.github.io/caret/subsampling-for-class-imbalances.html
  • 我知道这一点,但这是为了分类。如果不是,请纠正我。谢谢。
  • 随机抽样是通常的程序。其他任何事情都可能有偏见。我投票将其迁移到 stats.stackoverflow,以防有适合不同程序的特殊情况。
  • @dww 我在这里发布了这个,因为响应性和善意通常更高(-:
  • 当然,但是尽管您将其表述为编程问题,但这确实是关于使用适当的统计方法的问题。这方面的专业知识和相关性已经过交叉验证。它在这里也跑题了,因为它要求推荐要使用的工具或功能。

标签: r regression


【解决方案1】:

这似乎完全可以接受,除非您有集群或任何其他可行的理由进行非随机抽样。我已经为线性回归做了数百次类似的事情。

【讨论】:

  • 为什么投反对票?如果您投了反对票 - 至少评论一下原因!
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-04-04
  • 2013-02-21
  • 2012-03-14
  • 2019-03-07
相关资源
最近更新 更多