【发布时间】:2017-03-20 03:45:11
【问题描述】:
如何有效地从 DataFrame 中选择 exact 数量的随机行? 数据包含一个可以使用的索引列。 如果我必须使用最大大小,索引列上的 count() 或 max() 哪个更有效?
【问题讨论】:
-
你不能只使用
df.sample()吗? -
@mtoto sample() 返回一个近似数字,但算法在某些情况下要求一个准确数字。
标签: apache-spark random spark-dataframe