【问题标题】:How to deal with Skewness on distribution in Spark如何处理 Spark 中的分布偏度
【发布时间】:2018-05-08 08:30:21
【问题描述】:

我在 Spark 集群中的数据分布存在问题,因为我需要一起处理的许多对象具有相同的键。因此,许多任务很快结束,但其中一个任务继续运行,直到执行程序的内存边界和集群应用程序出错并停止。该图显示了历史服务器内部发生的情况。

【问题讨论】:

    标签: apache-spark cluster-computing load-balancing distributed-computing


    【解决方案1】:

    这是分布式计算的最大挑战之一:分配每个任务的有效负载,从而获得最佳性能。

    换句话说,您需要在 w.r.t. 上平衡每个任务的工作量。到其他任务。

    您需要重新考虑您的问题并以另一种方式解决它(按照建议找到“辅助”键),或尝试执行仅适用于大任务的作业(即分发任务本身)。

    【讨论】:

    • 我同意,我肯定会在另一项任务中处理偏斜的起源,试图找到一个“辅助”键来分区和工作。
    猜你喜欢
    • 2017-02-06
    • 2021-05-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-10-03
    • 1970-01-01
    • 2021-01-15
    相关资源
    最近更新 更多