【发布时间】:2021-02-02 15:07:27
【问题描述】:
我已经构建了一个爬取某个网站的蜘蛛,它工作正常,我使用了scrapy。蜘蛛通过“下一页”分页链接抓取了我想要抓取的所有 430 个网页。问题是站点/爬虫也指向第 431 页,该页是空的。等等。因此,刮板不会停止刮!
在所有相关的 430 页面都被抓取后,谁能帮我停止网络抓取?最后一个相关页面中的 html 代码是:
我的代码是:
next_page = response.xpath('//a[@id="nextWebshopsPage"]').attrib['href']
if next_page is not None:
yield response.follow(next_page, callback=self.parse)
【问题讨论】:
标签: selenium xpath pagination scrapy