【发布时间】:2015-02-24 21:05:28
【问题描述】:
如果后续 yield 请求的 response.status 为 404,我试图打破一个循环。我正在迭代页码,但不知道有多少页可用。最终我会点击一个 404 页面,我希望它打破 while 循环。我把它硬编码成 40 页,但有 40 多页
def parse(self, response):
cat = json.loads(response.body_as_unicode())
for c in cat:
while **RESPONSE.STATUS == 200**:
url = 'http://www.url.com/'+str(c)+'/'+str(page)+'.json'
page += 1
yield Request(url, callback=self.parse_cats)
def parse_cats(self, response):
if response.status == '404':
**BREAK ABOVE LOOP**
我查看了 Request(errback=) 但不确定这是否是解决此问题的正确方法。
任何帮助将不胜感激!
【问题讨论】:
标签: python web-scraping scrapy scrapy-spider