【发布时间】:2016-10-27 15:14:10
【问题描述】:
在 apache spark 中,可以使用sparkContext.union() 方法有效地联合多个 RDD。如果有人想与多个 RDD 相交,是否有类似的东西?我在 sparkContext 方法中进行了搜索,但在其他任何地方都找不到任何东西。一种解决方案可能是合并 rdds,然后检索重复项,但我认为它不会那么有效。假设我有以下带有键/值对集合的示例:
val rdd1 = sc.parallelize(Seq((1,1.0),(2,1.0)))
val rdd2 = sc.parallelize(Seq((1,2.0),(3,4.0),(3,1.0)))
我想检索一个包含以下元素的新集合:
(1,2.0) (1,1.0)
但当然是多个 rdds 而不仅仅是两个。
【问题讨论】:
-
为什么要交叉多个rdds?依据是什么?
-
我想现在我的问题更好理解了。
标签: scala apache-spark