【发布时间】:2016-02-29 17:53:20
【问题描述】:
我的 scrapy 爬虫始终无法按预期工作。
我从网上商店废弃了一些类别,其中每个类别页面都包含分页,但有时它不包含链接分页,因为只有一个页面
我的规则只有在链接分页在我选择的页面内时才有效,但当类别的根页面是唯一的页面时,我不知道如何使它工作。
这是我的规则。
rules = [
Rule(LinkExtractor(allow=(),restrict_xpaths=('//a[@class="button button_gris button_medium"]',)), callback='parse_item', follow=True)
知道如何让它也刮掉不包含我定位的分页链接的页面。
注意:
我使用由 mysqlDB 填充的起始 url 启动爬虫,例如,arg 表用于选择我的链接表,其中使用了起始 url。
scrapy crawl mg_bot_crawler -a table=mini_four
感谢您的帮助
【问题讨论】:
标签: python scrapy scrapy-spider