【发布时间】:2012-06-23 02:57:27
【问题描述】:
我正在抓取一个网站(只有两个级别的深度),我想从两个级别的网站上抓取信息。我遇到的问题是我想用两个级别的信息填写一个项目的字段。我该怎么做?
我正在考虑将项目列表作为实例变量,所有线程都可以访问(因为它是蜘蛛的同一个实例),并且 parse_1 将填写一些字段,而 parse_2 将必须检查正确的填写相应值之前的key。这种方法看起来很繁琐,我仍然不知道如何使它起作用。
我在想一定有更好的方法,也许以某种方式将一个项目传递给回调。不过,我不知道如何使用 Request() 方法来做到这一点。想法?
【问题讨论】:
标签: python web-scraping scrapy web-crawler multi-level