【发布时间】:2016-08-26 17:54:08
【问题描述】:
我正在尝试创建已提交 Spark 应用程序的状态图。当应用程序被视为失败时,我有点迷失了。
【问题讨论】:
标签: apache-spark driver scheduling distributed-computing bigdata
我正在尝试创建已提交 Spark 应用程序的状态图。当应用程序被视为失败时,我有点迷失了。
【问题讨论】:
标签: apache-spark driver scheduling distributed-computing bigdata
这个阶段非常重要,因为说到大数据,Spark 很棒,但是让我们面对现实吧,我们还没有解决问题!
当一个任务/作业失败时,Spark 会重新启动它(回想一下,Spark 提供的主要抽象 RDD 是一个 Resilient 分布式数据集,这不是我们在这里寻找的,而是会给出直觉)。
我使用 Spark 1.6.2,我的集群重新启动作业/任务 3 次,此时它被标记为 FAILED。
例如,我最近的一项工作必须重新开始整个阶段:
在集群/应用程序中,可以看到尝试 ID,这里是应用程序的第三次也是最后一次尝试:
如果该尝试被标记为 FAILED(无论出于何种原因,例如内存不足、DNS 错误、GC 分配内存、磁盘故障、节点没有响应 4 次心跳(可能已关闭)等),然后 Spark 重新启动作业。
【讨论】: