【发布时间】:2019-08-12 06:37:32
【问题描述】:
为了减少两个 RDD 加入过程中的洗牌,我决定首先使用 HashPartitioner 对它们进行分区。这是我的做法。我这样做是正确的,还是有更好的方法来做到这一点?
val rddA = ...
val rddB = ...
val numOfPartitions = rddA.getNumPartitions
val rddApartitioned = rddA.partitionBy(new HashPartitioner(numOfPartitions))
val rddBpartitioned = rddB.partitionBy(new HashPartitioner(numOfPartitions))
val rddAB = rddApartitioned.join(rddBpartitioned)
【问题讨论】:
标签: scala apache-spark rdd partitioner