【发布时间】:2016-02-09 10:03:21
【问题描述】:
所以,我创建了这个类,以便我可以使用 Scrapy 按需抓取:
from scrapy import signals
from scrapy.crawler import CrawlerProcess, Crawler
from scrapy.settings import Settings
class NewsCrawler(object):
def __init__(self, spiders=[]):
self.spiders = spiders
self.settings = Settings()
def crawl(self, start_date, end_date):
crawled_items = []
def add_item(item):
crawled_items.append(item)
process = CrawlerProcess(self.settings)
for spider in self.spiders:
crawler = Crawler(spider, self.settings)
crawler.signals.connect(add_item, signals.item_scraped)
process.crawl(crawler, start_date=start_date, end_date=end_date)
process.start()
return crawled_items
基本上,我有一个长时间运行的进程,我会多次调用上述类的crawl方法,像这样:
import time
crawler = NewsCrawler(spiders=[Spider1, Spider2])
while True:
items = crawler.crawl(start_date, end_date)
# do something with crawled items ...
time.sleep(3600)
问题是,第二次调用crawl,会出现这个错误:twisted.internet.error.ReactorNotRestartable。
据我所知,这是因为反应堆停止后无法运行。有什么解决办法吗?
谢谢!
【问题讨论】:
标签: python scrapy web-crawler reactor