【问题标题】:How can I ensure certain hadoop jobs dont end up running in the same datanode when using Fair Scheduler?使用 Fair Scheduler 时,如何确保某些 hadoop 作业不会在同一个数据节点中运行?
【发布时间】:2011-09-21 13:42:40
【问题描述】:

使用 nutch 爬虫时,会创建抓取作业,以使来自同一主机的 URL 最终位于单个数据节点中,以保持抓取礼貌 (1 QPS)。但是,某些主机允许超过 1 个 QPS,因此 URL 会相应地进行分区。对于此类主机,URL 将位于两个获取作业中,旨在在两个不同的数据节点上运行。但有时公平调度程序将这些作业(减少任务)调度到同一个数据节点。

那么有什么办法可以解决这个问题吗?

非常感谢任何帮助。

谢谢

【问题讨论】:

    标签: hadoop scheduling nutch


    【解决方案1】:

    我不确定您是否想这样做,因为它会影响您的 Hadoop 集群的其余部分...

    您可以将每个节点的 reduce slot 数设置为 1。您要为此更改的配置参数是 mapred.tasktracker.reduce.tasks.maximum

    【讨论】:

    • 感谢您的回答。但是我们必须至少有 3 个 reduce slot。我可以修改公平调度程序的某些部分来做到这一点吗?有什么想法吗?
    猜你喜欢
    • 1970-01-01
    • 2017-07-31
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-03-26
    • 1970-01-01
    • 1970-01-01
    • 2011-09-10
    相关资源
    最近更新 更多