【发布时间】:2018-09-02 20:43:55
【问题描述】:
我正在使用一个 ec2 hadoop 集群,该集群由 20 台 c3.8xlarge 机器组成,每台机器都有 60 GB RAM 和 32 个虚拟 CPU。 在每台机器上,我都按照https://docs.aws.amazon.com/emr/latest/ReleaseGuide/emr-hadoop-task-config.html 的文档设置了 yarn 和 mapreduce 设置,即如下所示:
c3.8xlarge
Configuration Option Default Value
mapreduce.map.java.opts -Xmx1331m
mapreduce.reduce.java.opts -Xmx2662m
mapreduce.map.memory.mb 1664
mapreduce.reduce.memory.mb 3328
yarn.app.mapreduce.am.resource.mb 3328
yarn.scheduler.minimum-allocation-mb 32
yarn.scheduler.maximum-allocation-mb 53248
yarn.nodemanager.resource.memory-mb 53248
现在我必须使用什么标准来确定最适合与 giraph 一起使用的工人数量? IE。我必须为 -w 参数使用什么数字?该标准与上述设置有关吗?
【问题讨论】:
标签: hadoop amazon-ec2 hadoop-yarn giraph