【发布时间】:2011-12-07 15:51:59
【问题描述】:
我已经开始使用Scrapy 抓取一些网站。如果我稍后向我的模型添加一个新字段或更改我的解析功能,我希望能够离线“重播”下载的原始数据以再次抓取它。看起来 Scrapy 曾经有能力将原始数据存储在回放文件中:
http://dev.scrapy.org/browser/scrapy/trunk/scrapy/command/commands/replay.py?rev=168
但是这个功能似乎已经在当前版本的 Scrapy 中被移除了。还有其他方法可以实现吗?
【问题讨论】:
-
您是否尝试在 ML 处询问?如果我在那里问你的问题并粘贴答案,这对我来说是不公平的:P
-
如果你有我的问题的解决方案,我很好 - 只需参考你的来源;)
标签: python web-crawler scrapy