【问题标题】:Can I use Heroku to Scrape Data to later Download?我可以使用 Heroku 抓取数据以供以后下载吗?
【发布时间】:2017-09-24 12:42:42
【问题描述】:

我有一个 Python 脚本,可以抓取来自不同网站的数据,然后将一些数据写入 CSV 文件。

我每天都在本地计算机上运行它,但我想让它在服务器上自动运行并且可能是免费的。

我尝试了 PythonAnywhere,但看起来他们的白名单阻止了我抓取bloomberg.com。

然后我传递给 Heroku,我部署了我的工人(python 脚本)。一切似乎都正常,但是使用 Heroku bash 查找 python 脚本应该写入 CSV 文件的目录没有出现。

我还意识到,我不知道如何下载这些 CSV 文件,以防它们被写入。

我想知道我是否真的可以使用 Heroku 实现我想要实现的目标,或者让 python 脚本在服务器上运行的唯一方法是支付 PythonAnywhere 并避免抓取限制?

【问题讨论】:

    标签: python csv heroku web-scraping download


    【解决方案1】:

    Heroku 的文件系统是 per-dyno 和短暂的。您不得将内容保存到其中以备后用。

    另一种方法是将其写入永久位置,例如 Amazon S3。您可以为此使用boto 库。虽然您必须为 S3 存储和数据付费,但它非常便宜。

    【讨论】:

    • 难道我不能对任何网络空间提供商做同样的事情吗?或者由于某种原因,只有 Amazon S3 可以与 Heroku 一起使用?
    • 你还想些什么? S3 是这类事情的常用解决方案,但我猜谷歌和微软也有类似的产品。关键是你想要的东西只对你存储的数据收费。
    • 是的,亚马逊是一个很好的解决方案,但我在考虑是否也可以提供像 000Webhost 这样的免费网络空间。请记住,我是新手,所以可能是个愚蠢的问题
    • 但是 S3 或同等产品具有专门用于上传和检索单个文件的 API 和库。一般的网络托管服务不会有这样的。
    • S3 也可以运行 python 吗?在这一点上,我不再需要 Heroku 了.. 对吗?
    猜你喜欢
    • 1970-01-01
    • 2021-01-03
    • 2021-06-19
    • 2018-02-28
    • 2019-08-02
    • 1970-01-01
    • 2019-12-27
    • 2017-01-11
    • 1970-01-01
    相关资源
    最近更新 更多