【发布时间】:2015-05-27 07:05:26
【问题描述】:
我已经创建了这样的地图 -
val b = a.map(x => (x(0), x) )
这里的 b 是类型
org.apache.spark.rdd.RDD[(Any, org.apache.spark.sql.Row)]
- 如何使用值行中的字段对每个键中的 PairRDD 进行排序?
- 之后,我想运行一个函数,该函数按照之前的排序顺序单独处理每个 Key 的所有值。那可能吗?如果可以,请举个例子。
- 对 Pair RDD 进行分区是否需要考虑任何因素?
【问题讨论】:
-
简单的方法是按键分组,然后对(本地)值可迭代对象进行排序,然后对值运行函数。如果一个键没有太多值,这是可行的。
标签: scala apache-spark