【发布时间】:2016-08-18 03:52:42
【问题描述】:
The scrapy documentation 特别提到如果我想将响应传递给蜘蛛而不实际获取网页,我应该使用下载器中间件。但是,我找不到任何有关如何实现此功能的文档或示例。
我有兴趣仅将 url 传递给请求回调,使用 url(及其某些排列)填充项目的 file_urls 字段,并使用 FilesPipeline 处理实际下载。
如何编写一个将 url 传递给蜘蛛的下载器中间件类,同时避免下载网页?
【问题讨论】:
标签: scrapy