【发布时间】:2014-02-08 04:59:09
【问题描述】:
我正在 hadoop 上运行一些 map reduce 任务。映射器用于生成数据,因此不依赖于 hdfs 块放置。为了测试我的系统,我使用了 2 个节点和一个主节点。我正在用纱线对 hadoop-2.0 进行测试。
我发现 hadoop 有一些非常不舒服的地方。我已将其配置为运行 8 个地图任务。不幸的是,hadoop 在一个节点上启动了所有 8 个地图任务,而另一个节点几乎是理想的。有 4 个减速器,它也不平衡这些减速器。发生这种情况时,确实会导致性能不佳。
我在作业跟踪器和任务跟踪器的 mapred-site.xml 中设置了这些属性
<property>
<name>mapreduce.tasktracker.map.tasks.maximum</name>
<value>2</value>
</property>
<property>
<name>mapreduce.tasktracker.reduce.tasks.maximum</name>
<value>2</value>
</property>
谁能解释一下这个问题是否可以解决,或者为什么hadoop会存在这样的问题?
【问题讨论】:
-
您能否描述更多关于“生成数据,因此不依赖于 hdfs 块放置”的信息。了解工作的数据来源?
-
它基本上就像 hadoop 中的随机文本生成器,其中映射器生成随机数据。您实际上并不需要输入数据源。
标签: hadoop mapreduce hadoop-yarn