【发布时间】:2013-08-29 18:57:28
【问题描述】:
调试 Hadoop map-reduce 作业很痛苦。我可以打印到标准输出,但这些日志显示在运行 MR 作业的所有不同机器上。我可以去 jobtracker,找到我的工作,然后单击每个单独的 mapper 以访问其任务日志,但是当您有 20 多个 mapper/reducer 时,这非常麻烦。
我在想我可能需要编写一个脚本来遍历作业跟踪器,以找出每个映射器/减速器在哪台机器上运行,然后将日志 scp 回一个中心位置,在那里它们可能是 cat'一起编。在我浪费时间做这件事之前,是否有人知道一种更好的方法来为作业的映射器和减速器获取一个合并的标准输出日志?
【问题讨论】: