【问题标题】:Apache Nutch 2.1 different batch id (null)Apache Nutch 2.1 不同的批次 id (null)
【发布时间】:2013-02-12 08:33:01
【问题描述】:

我使用 Apache Nutch 2.1 抓取了几个网站。

在抓取时,我在很多页面上看到以下消息:
前任。跳过http://www.domainname.com/news/subcategory/111111/index.html;不同的批次 id (null)。

是什么导致了这个错误?
我该如何解决这个问题,因为不同批次 id (null) 的页面没有存储在数据库中。

我爬的网站是基于drupal的,但是我尝试过很多其他非drupal的网站。

【问题讨论】:

  • 你能解决这个问题吗?
  • 没有。我尝试了几个星期,但没有成功。之后我停止使用 Nutch。像替代方案一样,您可以使用 php 爬虫:linklink
  • 我找到了适合我需要的解决方法。 Python scrapey 也很棒:scrapy.org

标签: apache nutch web-crawler


【解决方案1】:

我认为,消息没有问题。 batch_id 未分配给所有 url。因此,如果 batch_id 为 null ,请跳过 url。为 url 关联 batch_id 时生成 url。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2012-08-04
    • 1970-01-01
    相关资源
    最近更新 更多