【问题标题】:RDD: Preserve total order when repartitioningRDD:重新分区时保留总顺序
【发布时间】:2018-12-10 13:38:13
【问题描述】:

关于 RDD 中的顺序,我的一个假设似乎是不正确的 (related)。

假设我希望在对 RDD 进行排序后对其进行重新分区。

import random

l = list(range(20))
random.shuffle(l)

spark.sparkContext\
.parallelize(l)\
.sortBy(lambda x:x)\
.repartition(3)\
.collect()

产量:

[16, 17, 18, 19, 0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15]

如我们所见,顺序保留在一个分区中,但总顺序并未保留在所有分区中。

我想保留 RDD 的总顺序,如下所示:

[0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19]

我很难在网上找到任何可以提供帮助的东西。帮助将不胜感激。

【问题讨论】:

  • 使用 coalesce(1) 使其成为单个分区
  • @Kishore,我处理数十亿行,所以很遗憾这行不通。
  • 重新分区后排序不是一个选项吗?
  • @shaido,肯定会的。它会保留分区吗?

标签: apache-spark pyspark rdd


【解决方案1】:

看来我们可以向sortBy 函数提供参数numPartitions=partitions 来对RDD 进行分区并保持总顺序:

import random

l = list(range(20))
random.shuffle(l)

partitions = 3

spark.sparkContext\
.parallelize(l)\
.sortBy(lambda x:x ,numPartitions=partitions)\
.collect() 

【讨论】:

    猜你喜欢
    • 2015-05-30
    • 1970-01-01
    • 2018-01-26
    • 1970-01-01
    • 1970-01-01
    • 2016-03-14
    • 1970-01-01
    • 2014-06-27
    • 1970-01-01
    相关资源
    最近更新 更多