【问题标题】:With nutch crawl, if I use smaller values for -topN and -depth, will it still crawl all the same pages?使用 nutch crawl 时,如果我为 -topN 和 -depth 使用较小的值,它还会爬取所有相同的页面吗?
【发布时间】:2016-10-12 01:51:05
【问题描述】:

我正在运行 Nutch 1.4/Solr 4.10 来索引多个站点。我的爬网包括许多带有数百个链接的种子页面。我目前正在运行

-topN 400 -depth 20

使用这些设置,完成抓取需要 5-7 小时。我想让“nutch crawl”的每个单独迭代花费更少的时间,但我需要确保最终抓取所有页面。 我可以减少我的 -topN 或 -depth 值并仍然确保所有页面都会被抓取吗?

【问题讨论】:

    标签: nutch


    【解决方案1】:

    更改深度(实际上应该有一个不同的名称,它是迭代次数,通常与深度相同但不一定)不会产生太大影响,因为一旦没有,抓取就会停止迭代任何要获取的 URL。 topN 限制了每个段的 URL 总数:如果您设置较低的值,则会进行更多的迭代,但作为一个整体,它不应该影响您的爬网需要多长时间。

    影响爬网速度的因素有很多see WIKI,但这只是主机多样性和礼貌的问题。我建议您在伪分布式模式下运行 Nutch,并使用 Hadoop UI 了解哪些步骤需要时间并从那里开始。

    PS:那是 Nutch 的一个非常旧的版本。也许是时候升级到更新的了?

    【讨论】:

    • 如果您的抓取时间紧迫,您可能想看看 StormCrawler。与 Nutch 批量运行不同,SC 连续运行,更好地利用服务器资源。它总是在获取、解析和更新,而 Nutch 轮流执行这些操作。
    猜你喜欢
    • 1970-01-01
    • 2014-07-27
    • 2015-01-06
    • 1970-01-01
    • 2016-02-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多