【发布时间】:2018-01-28 20:22:17
【问题描述】:
我有一个数据集<Tuple2<String, Double>>,如下:
<A,1>
<B,2>
<C,2>
<A,2>
<B,3>
<B,4>
并且需要使用 Spark Java API 将其通过 String 进行归约,以便最终结果如下所示:
<A,3>
<B,9>
<C,2>
我应该使用 Reduce、Agg、Group 还是 GroupByKey?以及如何?
【问题讨论】:
-
谢谢。我问的是数据集,而不是 RDD。
-
是的,但数据集只有 groupBy 或 groupByKey 和 reduceGroup 或 agg。没有reduceByKey,这就是我建议重复的原因。是的,不是,但您的问题也应该得到纠正
-
其实在Java中,Dataset有Reduce、Agg、Group和GroupByKey。刚刚更新了我的问题。
-
但不是 reduceByKey :P 这导致了我的错误。没关系,我撤回了我的近距离投票,对不起:)
标签: java apache-spark mapreduce dataset apache-spark-sql