【发布时间】:2019-07-06 03:45:37
【问题描述】:
目前我正在简单地使用:
down_sample_size = 3000
train <- train[sample(nrow(train), down_sample_size),]
对我的训练数据进行下采样,以使我的模型拟合得更快(在超参数搜索和 CV 的背景下 - 上面已简化)。有没有更好的方法来做到这一点?例如,在分类的背景下,必须考虑类先验和分层。但是,也许以上对于回归是可以接受的?谢谢。
【问题讨论】:
-
看看插入符号中的 downSample 函数,还有topepo.github.io/caret/subsampling-for-class-imbalances.html
-
我知道这一点,但这是为了分类。如果不是,请纠正我。谢谢。
-
随机抽样是通常的程序。其他任何事情都可能有偏见。我投票将其迁移到 stats.stackoverflow,以防有适合不同程序的特殊情况。
-
@dww 我在这里发布了这个,因为响应性和善意通常更高(-:
-
当然,但是尽管您将其表述为编程问题,但这确实是关于使用适当的统计方法的问题。这方面的专业知识和相关性已经过交叉验证。它在这里也跑题了,因为它要求推荐要使用的工具或功能。
标签: r regression