【发布时间】:2014-12-20 10:32:30
【问题描述】:
我有一个RDD[T] 和一个谓词T => Boolean。
如何计算所有项目是否适合/不适合谓词?
当然可以这样:
rdd
.map(predicate)
.reduce(_ && _)
但这将需要完整的集合来迭代,这是一个矫枉过正。
我尝试了另一种适用于 local[1] 的方法,但似乎也遍历了真实集群上的所有内容:
rdd
.map(predicate)
.first()
[如果找不到任何需要,则失败并出现异常]
实现这一目标的规范方法是什么?
【问题讨论】:
标签: scala apache-spark rdd