【发布时间】:2013-02-12 08:33:01
【问题描述】:
我使用 Apache Nutch 2.1 抓取了几个网站。
在抓取时,我在很多页面上看到以下消息:
前任。跳过http://www.domainname.com/news/subcategory/111111/index.html;不同的批次 id (null)。
是什么导致了这个错误?
我该如何解决这个问题,因为不同批次 id (null) 的页面没有存储在数据库中。
我爬的网站是基于drupal的,但是我尝试过很多其他非drupal的网站。
【问题讨论】:
-
你能解决这个问题吗?
-
我找到了适合我需要的解决方法。 Python scrapey 也很棒:scrapy.org
标签: apache nutch web-crawler