【发布时间】:2019-06-04 03:29:31
【问题描述】:
像"select id from table order by rand()" 这样的查询所需的内存将超过分配的内存,从而导致查询失败。如何从一个非常大的表中获得所有行的随机排列?表的大小超过 10 亿行。
【问题讨论】:
-
你能告诉我们你为什么认为你需要它吗?你真正的用例是什么?
-
感谢您的建议!我对收到的每一个有用的回复都投赞成票。但是,由于声誉低或我的其他原因,我的点赞不会显示给其他用户。
-
我们团队的业务需要从整个数据集中反复采样。样本量每次从 8000 万到 100k 不等,预计每个样本不会与其他最近的样本重复。我们有超过 10 亿行要处理,每次我需要从数据集中进行采样时都需要进行重复数据删除。
-
我明白了。谢谢
-
感谢您的澄清 - 有道理。看答案
标签: google-bigquery