【发布时间】:2016-11-19 05:10:59
【问题描述】:
我正在运行pyspark、spark 1.3、standalone mode、client mode。
我正在尝试通过查看过去的工作并进行比较来调查我的火花工作。我想查看他们的日志、提交作业的配置设置等。但是在上下文关闭后查看作业日志时遇到了麻烦。
当我提交工作时,我当然会打开一个 spark 上下文。在作业运行时,我可以使用 ssh 隧道打开 spark web UI。而且,我可以通过localhost:<port no> 访问转发端口。然后我可以查看当前正在运行的作业以及已完成的作业,如下所示:
然后,如果我希望查看特定作业的日志,我可以通过使用 ssh 隧道端口转发来查看该作业的特定机器的特定端口上的日志。
然后,有时作业会失败,但上下文仍然是打开的。发生这种情况时,我仍然能够通过上述方法查看日志。
但是,由于我不想同时打开所有这些上下文,所以当作业失败时,我会关闭上下文。当我关闭上下文时,该作业出现在上图中的“已完成的应用程序”下。现在,当我尝试使用 ssh 隧道端口转发查看日志时,和以前一样 (localhost:<port no>),它给了我一个 page not found。
如何在上下文关闭后查看作业的日志?而且,这意味着spark context 与日志保存位置之间的关系是什么?谢谢。
再次,我正在运行pyspark、spark 1.3、standalone mode、client mode。
【问题讨论】:
标签: apache-spark ssh pyspark tunneling apache-spark-1.3