【发布时间】:2019-04-28 10:31:33
【问题描述】:
我正在尝试对该站点的页面进行分页 (http://www.geny-interim.com/offres/)。问题是我使用 css 选择器通过此代码浏览每个页面
next_page_url=response.css('a.page:nth-child(4)::attr(href)').extract_first()
if next_page_url:
yield scrapy.Request(next_page_url)
但是这样做只会分页到两个页面,然后 css 选择器无法按预期工作。我也试过用这个:
response.xpath('//*[contains(text(), "›")]/@href/text()').extract_first()
但这也会产生价值错误。任何帮助都会被赞成。
【问题讨论】:
-
所有页面是什么意思?您的意思是爬取网站还是仅查找页面上发布的所有职位列表?
-
我的意思是访问每个页面(分页)
标签: python-2.7 scrapy ascii non-ascii-characters