【问题标题】:how to crawl a website by specifying depth如何通过指定深度来抓取网站
【发布时间】:2014-08-01 06:10:43
【问题描述】:

我正在使用 nutch 2.x。所以我尝试使用带有深度选项的 nutch 命令作为

$: nutch 注入 ./urls/seed.txt -depth 5

执行此命令后收到类似

的消息

无法识别的 arg -depth

所以当我失败时,我尝试使用 nutch crawl as

$: nutch crawl ./urls/seed.txt -depth 5

得到类似的错误

命令爬取已弃用,请改用 bin/crawl

所以我尝试使用 crawl 命令在 seed.txt 中使用深度选项来抓取 url,在这种情况下它要求 solr 但我没有使用 solr

所以我的问题是如何通过指定深度来抓取网站

【问题讨论】:

    标签: solr nutch web-crawler


    【解决方案1】:

    我的问题是你想通过抓取页面而不是在 SOLR 中对其进行索引来做什么?

    回答你的问题:

    如果您想使用 Nutch Crawler 并且不想将其索引到 SOLR 中,请从抓取脚本中删除以下代码。

    http://technical-fundas.blogspot.com/2014/07/crawl-your-website-using-nutch-crawler.html

    回答你的其他问题:

    如何获取Nutch已抓取的所有链接的HTML内容(查看此链接):

    How to get the html content from nutch

    这肯定会解决您的问题。

    【讨论】:

    • 首先感谢您回答这项工作,我的意思是它工作正常并且没有显示任何错误,但它仍然没有给出外链的 html 内容意味着它没有进入指定的深度,所以如果你能帮忙获取外链的 html 内容
    • 您的问题是什么:1) 没有深入了解或 2) 没有获取 HTML 内容您之前的问题是关于深度的,我希望我的解决方案能够深度抓取网站。
    • 好的,我想将特定页面上所有外链的 html 内容获取到我的 hbase 数据库中的指定深度,其中 url 作为键,并且 html 内容将在 f:cnt 列中,你明白了吗或者你想让我详细说明一下。
    • 但如果你能帮助我,我怎样才能让 nutch 给我外链的 html 内容
    • Nutch crawldb/segmentdb 已经包含 nutch 已爬取的所有外链的 html 内容....您需要进一步调查如何将该内容获取到除 solr 之外的其他目的地。顺便说一句,我想我已经回答了你关于如何跳过 solr 并在 N 深度中抓取网站的原始问题。如果您接受它作为答案,那么其他人也可以得到相同问题的答案。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2013-11-11
    • 2023-03-17
    • 1970-01-01
    • 2019-09-30
    • 1970-01-01
    • 2016-10-14
    • 2020-10-07
    相关资源
    最近更新 更多