【发布时间】:2016-06-30 06:48:19
【问题描述】:
我在 scala 中调用一个函数,它给出一个RDD[(Long,Long,Double)] 作为它的输出。
def helperfunction(): RDD[(Long, Long, Double)]
我在代码的另一部分循环调用这个函数,我想合并所有生成的 RDD。调用函数的循环看起来像这样
for (i <- 1 to n){
val tOp = helperfunction()
// merge the generated tOp
}
我想做的事情类似于 StringBuilder 在你想要合并字符串时在 Java 中为你做的事情。我看过合并 RDD 的技术,主要指向使用这样的联合函数
RDD1.union(RDD2)
但这需要在合并之前生成两个 RDD。我虽然初始化了一个 var RDD1 以在 for 循环之外累积结果,但我不确定如何初始化 [(Long,Long,Double)] 类型的空白 RDD。我也是从 spark 开始的,所以我什至不确定这是否是解决这个问题的最优雅的方法。
【问题讨论】:
标签: scala apache-spark rdd