【发布时间】:2015-12-26 13:16:51
【问题描述】:
为什么即使分数参数相同,Spark RDD 上的rdd.sample() 函数也会返回不同数量的元素?例如,如果我的代码如下:
val a = sc.parallelize(1 to 10000, 3)
a.sample(false, 0.1).count
每次我运行代码的第二行时,它都会返回一个不等于 1000 的不同数字。实际上,我希望每次都能看到 1000,尽管 1000 个元素可能不同。谁能告诉我如何获得样本量正好等于 1000 的样本?非常感谢。
【问题讨论】:
标签: apache-spark sample rdd