【发布时间】:2017-01-17 03:52:45
【问题描述】:
这是 Spark 2.2.0-SNAPSHOT。
为什么下例中groupBy变换后的分区数为200?
scala> spark.range(5).groupByKey(_ % 5).count.rdd.getNumPartitions
res0: Int = 200
200 有什么特别之处?为什么不是像1024 这样的其他号码?
有人告诉我 Why does groupByKey operation have always 200 tasks? 专门询问 groupByKey,但问题是选择 200 作为默认值背后的“谜团”,而不是为什么默认有 200 个分区。
【问题讨论】:
标签: apache-spark