【发布时间】:2016-05-17 02:27:01
【问题描述】:
我正在尝试通过利用一些分区策略来优化一段 PySpark 代码,特别是对两个 RDDS 进行共同分区,合并它们,并对它们调用 reduce 操作(它比这更复杂,但这是一个很好的初始模型)。
看图:
(来源:reactivesoftware.pl)
co-partition join 非常高效且精简。我的问题是,我怎么知道我的加入/减少是正确的共同分区?我应该在 Spark 应用程序 UI 上看到哪些统计信息?我应该期望看到哪些性能改进?
【问题讨论】:
标签: apache-spark mapreduce pyspark