【发布时间】:2016-01-25 02:01:51
【问题描述】:
基本上我的程序具有以下结构。
def first_parse:
for link in links:
yield Request(url = link, callback = second_parse)
def second_parse:
# webDriver.get(url) and crawl data.
我正在使用 selenium Webdriver 从 first_parse 加载 url。对于每个页面,程序都需要一些时间来加载页面并完成工作。但由于某些原因,我总是错过链接中的一些链接。
所以我怀疑当 yield 操作将请求发送到 second_parse 时,但 second_parse 仍在处理上一个请求。所以请求错过了。我说的对吗?
如果没有,当产量发送请求时发生了什么?
例如,如果有 20 个链接,first_parse 将向 second_parse 函数发送 20 个请求。 second_parse 每个请求需要 10 秒,所以当第一个请求在 second_parse 上运行时,其他请求将在队列中等待?还是刚走了?
【问题讨论】:
标签: python selenium selenium-webdriver scrapy scrapy-spider