【发布时间】:2017-02-23 13:19:17
【问题描述】:
我的 hadoop 集群遇到了一些问题。 我试图用它做一些基准测试来检查它的性能,看看 mapreduce 是否工作正常,但我得到了一些奇怪的行为。 事实上,mapreduce 正在开始并处理它的映射阶段,但我从中得到了一些错误: 我首先使用 teragen 创建数据:
$ hadoop jar /usr/local/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-*.jar teragen 500 random-data
然后工作开始,我在没有停止进程的情况下遇到了一些失败:
17/02/23 12:29:27 INFO client.RMProxy: 在 /172.16.138.145:8032 连接到 ResourceManager
17/02/23 12:29:28 INFO terasort.TeraSort:使用 2 生成 500
17/02/23 12:29:28 INFO mapreduce.JobSubmitter:拆分数:2
17/02/23 12:29:28 INFO mapreduce.JobSubmitter:提交作业令牌:job_1487846108320_0007
17/02/23 12:29:28 INFO impl.YarnClientImpl: 提交申请 application_1487846108320_0007
17/02/23 12:29:28 INFO mapreduce.Job:跟踪作业的 url:http://172.16.138.145:8088/proxy/application_1487846108320_0007/
17/02/23 12:29:28 INFO mapreduce.Job:正在运行的作业:job_1487846108320_0007
17/02/23 12:29:34 INFO mapreduce.Job: Job job_1487846108320_0007 以超级模式运行:false
17/02/23 12:29:34 INFO mapreduce.Job: map 0% reduce 0%
17/02/23 12:29:47 信息 mapreduce.Job:任务 ID: 尝试_1487846108320_0007_m_000001_0,状态:失败
17/02/23 12:29:48 信息 mapreduce.Job:任务 ID:尝试_1487846108320_0007_m_000000_0,状态:失败
17/02/23 12:30:02 INFO mapreduce.Job: map 50% reduce 0%
17/02/23 12:30:02 信息 mapreduce.Job:任务 ID:尝试_1487846108320_0007_m_000001_1,状态:失败
17/02/23 12:30:03 INFO mapreduce.Job: map 0% reduce 0%
17/02/23 12:30:03 INFO mapreduce.Job:任务 ID:尝试_1487846108320_0007_m_000000_1,状态:失败
17/02/23 12:30:15 信息 mapreduce.Job:任务 ID:尝试_1487846108320_0007_m_000001_2,状态:失败
17/02/23 12:30:16 INFO mapreduce.Job:任务 ID:尝试_1487846108320_0007_m_000000_2,状态:失败
17/02/23 12:30:30 INFO mapreduce.Job: map 100% reduce 0%
17/02/23 12:30:31 INFO mapreduce.Job:作业 job_1487846108320_0007 失败,状态为 FAILED,原因是:任务失败 task_1487846108320_0007_m_000001
作业失败,因为任务失败。 failedMaps:1 failedReduces:0
我检查了相关数据节点中的日志,发现每次失败都会重复以下几行:
2017-02-23 11:36:12,901 INFO [AsyncDispatcher 事件处理程序] org.apache.hadoop.mapreduce.v2.app.job.impl.TaskAttemptImpl:尝试_1487846108320_0001_m_000001_1 TaskAttempt 从 RUNNING 转换为 FAIL_CONTAINER_CLEANUP
2017-02-23 11:36:12,901 INFO [AsyncDispatcher 事件处理程序] org.apache.hadoop.mapreduce.v2.app.job.impl.TaskAttemptImpl:来自尝试_1487846108320_0001_m_000001_1 的诊断报告:
2017-02-23 11:36:12,902信息[containerlauncher#5] org.apache.hadoop.mapreduce.v2.app.launcher.containerlauncherimpl:处理事件enceftype:contains_remote_cleanup容器_1487846108320_0001_01_000004 TaskAtprete_1487846108320_0001_M_000001_1
2017-02-23 11:36:12,903 信息 [ContainerLauncher #5] org.apache.hadoop.mapreduce.v2.app.launcher.ContainerLauncherImpl:杀死尝试_1487846108320_0001_m_000001_1
2017-02-23 11:36:12,903 INFO [ContainerLauncher #5] org.apache.hadoop.yarn.client.api.impl.ContainerManagementProtocolProxy:打开代理:Datanode3:34121
2017-02-23 11:36:12,923 INFO [AsyncDispatcher 事件处理程序] org.apache.hadoop.mapreduce.v2.app.job.impl.TaskAttemptImpl:attempt_1487846108320_0001_m_000001_1 TaskAttempt 从 FAIL_CONTAINER_CLEANUP 转换为 FAIL_TASK_C >
2017-02-23 11:36:12,924 INFO [CommitterEvent Processor #2] org.apache.hadoop.mapreduce.v2.app.commit.CommitterEventHandler:处理事件 EventType:TASK_ABORT
2017-02-23 11:36:12,932 WARN [CommitterEvent Processor #2] org.apache.hadoop.mapreduce.lib.output.FileOutputCommitter:无法删除 hdfs://172.16.138.145:9000/user/hdfs /random-dataSmallV7.7/_temporary/1/_temporary/attempt_1487846108320_0001_m_000001_1
2017-02-23 11:36:12,932 INFO [AsyncDispatcher 事件处理程序] org.apache.hadoop.mapreduce.v2.app.job.impl.TaskAttemptImpl:尝试_1487846108320_0001_m_000001_1 TaskAttempt 从 FAIL_TASK_CLEANUP 转换为 FAILED
在这种情况下,作业失败,但有时我收到错误,但作业会成功。 (很少) 你知道这个 FAIL_CONTAINER_CLEANUP 可能是什么原因吗?或者这个问题的潜在原因? 这里只使用了mappers,没有请求reducer,但是当其他情况下涉及reducer时,也会发生错误。
提前感谢您的想法。
【问题讨论】:
标签: java apache hadoop mapreduce hadoop-yarn