【问题标题】:Spark RDD map and mapPartitions, is order of rows generated the same?Spark RDD map和mapPartitions,生成的行顺序是否相同?
【发布时间】:2020-01-01 07:43:51
【问题描述】:

以下内容: rdd.map(x=> xx) 相对 rdd.mapPartitions(x=> x.map(c=> cc))

两种情况下生成的转换后的RDD会是同一个顺序吗?

【问题讨论】:

    标签: apache-spark rdd


    【解决方案1】:

    是的,顺序(假设它是确定性的并且上游没有广泛的转换)将是相同的。 map(f) 只是 dd.mapPartions(_.map(f))` 的快捷方式。

    但是,在一般情况下,您永远不应该依赖 RDD 中的值顺序,除非这是使用明确定义的(如对唯一值进行排序)或作业仅包含源为确定性输入格式的窄转换(如一个与textFile一起使用)。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-03-17
      • 1970-01-01
      • 2019-07-10
      • 2017-11-06
      相关资源
      最近更新 更多