【问题标题】:How do I setup my scraper to run multiple spiders using a script or exe?如何设置我的爬虫使用脚本或 exe 运行多个蜘蛛?
【发布时间】:2017-12-05 04:02:21
【问题描述】:

我进入了我的第三个 scrapy 项目,而且我变得更加大胆了。 我想将此程序提供给非技术用户,因此要么使用 cmd 行,要么最好使用 .exe

首先,我开始使用 Crawler.Process,使用我想出的文档:

process = CrawlerProcess()
process.crawl(FirstSpider)
process.crawl(SecondSpider)
process.crawl(ThirdSpider)
process.crawl(LastSpider)
process.start()

每个蜘蛛都在自己的 .py 文件中,因此我将每个蜘蛛导入到一个蜘蛛中,并将这段代码放在底部,如果有更好的方法,我会全力以赴。

我尝试在命令对话框中按原样运行它,当我尝试导入其他蜘蛛时,它返回一个错误,说 scraper.list 不存在。

我可以使用 VS 代码终端使用典型的 scrapy crawl xyz 从文件中运行每个抓取工具...那么我们如何为最终用户包装它?

提前致谢。

【问题讨论】:

  • 总是把完整的错误信息(Traceback)询问(作为文本,而不是截图)

标签: python scrapy


【解决方案1】:

感谢 Furas,我为遗漏道歉,我最终解决了自己的问题。该脚本在文件结构中太深了,我不得不将其进一步向上移动。它无法读取 Scraper.items 文件夹内容,因为它没有向上移动,然后又返回文件路径。

我几乎完成了这个项目,但我遇到了出口商的问题,我在这里发布了这个问题: Using Scrapy JsonItemsLinesExporter, returns no value

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2017-09-11
    • 1970-01-01
    • 2012-04-06
    • 2022-11-26
    • 1970-01-01
    • 2010-12-03
    • 1970-01-01
    • 2014-03-04
    相关资源
    最近更新 更多