【问题标题】:How to stop Xpath pagination loop at empty webpage?如何在空网页上停止 Xpath 分页循环?
【发布时间】:2021-02-02 15:07:27
【问题描述】:

我已经构建了一个爬取某个网站的蜘蛛,它工作正常,我使用了scrapy。蜘蛛通过“下一页”分页链接抓取了我想要抓取的所有 430 个网页。问题是站点/爬虫也指向第 431 页,该页是空的。等等。因此,刮板不会停止刮!

在所有相关的 430 页面都被抓取后,谁能帮我停止网络抓取?最后一个相关页面中的 html 代码是:

我的代码是:

next_page = response.xpath('//a[@id="nextWebshopsPage"]').attrib['href']
    if next_page is not None:
        yield response.follow(next_page, callback=self.parse)

【问题讨论】:

    标签: selenium xpath pagination scrapy


    【解决方案1】:

    您需要在谓词中指定按钮不应被禁用

    '//a[@id="nextWebshopsPage" and not(@disabled)]'
    

    【讨论】:

      猜你喜欢
      • 2018-09-16
      • 2013-11-08
      • 2021-11-28
      • 1970-01-01
      • 2020-04-28
      • 1970-01-01
      • 1970-01-01
      • 2022-01-11
      • 2012-05-20
      相关资源
      最近更新 更多