【问题标题】:Update and fetch the latest data from scraped website on Heroku app从 Heroku 应用上的抓取网站更新和获取最新数据
【发布时间】:2020-03-25 13:36:43
【问题描述】:

我使用 Express.js 制作了一个 API,并使用 Cheeriojs 抓取了一个网站。我已经使用 heroku 部署了这个 API。我希望我的 Web 应用程序从抓取的网站获取最新数据,但我部署的应用程序没有这样做。它仍然显示旧数据。如何让它连续获取实时数据

【问题讨论】:

  • 提供更多信息。代码,日志,......没有人可以对不恰当的问题提供正确的答案。

标签: javascript express heroku cheerio


【解决方案1】:

您好,我遇到了类似的问题。出路是同时使用 cron 作业和数据库。 所以我将 cron 作业配置为每天访问我的网站两次以激活服务器(如果您有大量活跃用户,则不需要这个)。 因此,当服务器重新启动时,我的应用程序会检查存储在我的数据库中的数据(即,当服务器之前处于活动状态时从源中抓取的最后一个数据)是否与目标网站上当前存在的数据相同(来自我在哪里抓取数据)。如果是真的那么什么都不做,否则{ 使用最新数据更新数据库并在您的网站上显示相同的数据 } 这种方法的缺点是: 1.每天只更新两次数据 2.如果您的网站全天有很多活跃用户,他们的持续访问不会让您的应用服务器空闲,因此在您配置 cron 作业访问您的网站时,您的服务器可能会此时已在线,可能不会更新数据。

但是,对于不太活跃的用户,这种方式非常有效。 您可以从这里配置 cron 作业:https://cron-job.org/en/members/jobs/

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-03-14
    • 2013-05-21
    • 1970-01-01
    • 2020-01-09
    • 1970-01-01
    • 2014-07-06
    相关资源
    最近更新 更多