【发布时间】:2017-08-18 22:44:47
【问题描述】:
请查看以下有关 Scrapy 架构的链接。
https://doc.scrapy.org/en/latest/topics/architecture.html#component-downloader
我不明白第 5 点。
一旦页面完成下载,Downloader 会生成一个 Response(与该页面一起)并将其发送到 Engine,通过 Downloader Middlewares 传递(请参阅 process_response())。
这是否意味着它在我们的系统(RAM)中下载/加载整个页面,因为页面的大小大于响应(HTML)?
请参阅第 6 点。
Engine 接收到 Downloader 的 Response 并通过 Spider Middleware 传递给 Spider 进行处理(参见 process_spider_input())。
如果我在任何地方错了,请纠正我。
【问题讨论】:
标签: python web-scraping scrapy