这是一个在下载处理程序中间件中使用 selenium 和 phantomjs 无头网络驱动程序的工作示例。
class JsDownload(object):
@check_spider_middleware
def process_request(self, request, spider):
driver = webdriver.PhantomJS(executable_path='D:\phantomjs.exe')
driver.get(request.url)
return HtmlResponse(request.url, encoding='utf-8', body=driver.page_source.encode('utf-8'))
我希望能够告诉不同的蜘蛛使用哪个中间件,所以我实现了这个包装器:
def check_spider_middleware(method):
@functools.wraps(method)
def wrapper(self, request, spider):
msg = '%%s %s middleware step' % (self.__class__.__name__,)
if self.__class__ in spider.middleware:
spider.log(msg % 'executing', level=log.DEBUG)
return method(self, request, spider)
else:
spider.log(msg % 'skipping', level=log.DEBUG)
return None
return wrapper
settings.py:
DOWNLOADER_MIDDLEWARES = {'MyProj.middleware.MiddleWareModule.MiddleWareClass': 500}
为了让包装器工作,所有蜘蛛必须至少有:
middleware = set([])
包含一个中间件:
middleware = set([MyProj.middleware.ModuleName.ClassName])
以这种方式实现它而不是在蜘蛛中实现它的主要优点是您最终只会发出一个请求。例如,在 reclosedev 的第二个链接的解决方案中:下载处理程序处理请求,然后将响应交给蜘蛛。然后蜘蛛在它的 parse_page 函数中发出一个全新的请求——这是对相同内容的两个请求。
另一个例子:https://github.com/scrapinghub/scrapyjs
干杯!