【发布时间】:2014-07-23 15:57:13
【问题描述】:
我有一个在 Heroku 上运行的基本 Django Web 应用程序。我想添加一个蜘蛛来根据计划任务(例如通过APScheduler)抓取一些网络(例如使用Scrapy),以获取一些加载了收集数据的Django数据库表。
有人知道实现这种集成的基础文档或示例吗?我发现很难弄清楚。
【问题讨论】:
标签: python django heroku scrapy apscheduler
我有一个在 Heroku 上运行的基本 Django Web 应用程序。我想添加一个蜘蛛来根据计划任务(例如通过APScheduler)抓取一些网络(例如使用Scrapy),以获取一些加载了收集数据的Django数据库表。
有人知道实现这种集成的基础文档或示例吗?我发现很难弄清楚。
【问题讨论】:
标签: python django heroku scrapy apscheduler
我根本没有用过Scrapy,但我实际上是在使用APScheduler,而且使用起来非常简单。所以我的第一个猜测是使用 BackgroundScheduler(在您的 Django 应用程序中)并向其中添加一个作业来执行可调用的“spider " 定期。
这里的问题是如何将 Scrapy 项目嵌入到您的 Django 应用程序中,以便您可以访问其中一个“spider”和有效地将其用作计划作业中的可调用对象。
我可能帮不上什么忙,但我只是想给你一些kickstart 方向。我很确定,如果你仔细阅读 Scrapy 的 文档,你会成功的。
最好的。
【讨论】: