【发布时间】:2013-01-22 01:17:01
【问题描述】:
我正在抓取一个结构如下的网站:
Archive
Article 1
Authors
Author 1
Author 2
Title
Body
Comments
Comment 1
Comment 2
...
Authors 中的每个作者都有自己的个人资料页面。问题是作者写了多篇文章,所以当我的蜘蛛抓取网站时,我最终会一遍又一遍地抓取相同作者的个人资料。
如何使用 Scrapy 缓存作者个人资料?
【问题讨论】:
-
我认为scrapy知道之前访问过的链接,所以它不应该抓取已经抓取的页面
标签: python caching web-scraping scrapy web-crawler