【发布时间】:2016-10-12 01:51:05
【问题描述】:
我正在运行 Nutch 1.4/Solr 4.10 来索引多个站点。我的爬网包括许多带有数百个链接的种子页面。我目前正在运行
-topN 400 -depth 20
使用这些设置,完成抓取需要 5-7 小时。我想让“nutch crawl”的每个单独迭代花费更少的时间,但我需要确保最终抓取所有页面。 我可以减少我的 -topN 或 -depth 值并仍然确保所有页面都会被抓取吗?
【问题讨论】:
标签: nutch
我正在运行 Nutch 1.4/Solr 4.10 来索引多个站点。我的爬网包括许多带有数百个链接的种子页面。我目前正在运行
-topN 400 -depth 20
使用这些设置,完成抓取需要 5-7 小时。我想让“nutch crawl”的每个单独迭代花费更少的时间,但我需要确保最终抓取所有页面。 我可以减少我的 -topN 或 -depth 值并仍然确保所有页面都会被抓取吗?
【问题讨论】:
标签: nutch
更改深度(实际上应该有一个不同的名称,它是迭代次数,通常与深度相同但不一定)不会产生太大影响,因为一旦没有,抓取就会停止迭代任何要获取的 URL。 topN 限制了每个段的 URL 总数:如果您设置较低的值,则会进行更多的迭代,但作为一个整体,它不应该影响您的爬网需要多长时间。
影响爬网速度的因素有很多see WIKI,但这只是主机多样性和礼貌的问题。我建议您在伪分布式模式下运行 Nutch,并使用 Hadoop UI 了解哪些步骤需要时间并从那里开始。
PS:那是 Nutch 的一个非常旧的版本。也许是时候升级到更新的了?
【讨论】: