【发布时间】:2011-09-21 13:42:40
【问题描述】:
使用 nutch 爬虫时,会创建抓取作业,以使来自同一主机的 URL 最终位于单个数据节点中,以保持抓取礼貌 (1 QPS)。但是,某些主机允许超过 1 个 QPS,因此 URL 会相应地进行分区。对于此类主机,URL 将位于两个获取作业中,旨在在两个不同的数据节点上运行。但有时公平调度程序将这些作业(减少任务)调度到同一个数据节点。
那么有什么办法可以解决这个问题吗?
非常感谢任何帮助。
谢谢
【问题讨论】:
标签: hadoop scheduling nutch