【发布时间】:2020-07-11 23:06:01
【问题描述】:
目前,我有一台服务器正在运行。每当我收到请求时,我都想要一些机制来启动对其他资源(最好是动态创建)的抓取过程,因为我不想在我的主实例上执行抓取。此外,当我不抓取数据时,我不希望其他实例继续运行并向我收费。 所以,最好是一个我可以请求开始抓取网站并在完成后关闭的系统。
目前,我查看了谷歌云功能,但每个功能的上限为 9 分钟,因此它不符合我的要求,因为抓取会花费更多时间。我还查看了 AWS SDK,它允许我们在运行时创建虚拟机并关闭它们,但我不知道如何将我的 API 脚本推送到新创建的 AWS 实例上。
此外,系统应该是可扩展的。就像我有许多不同的脚本可以抓取不同的网站。因此,一个强大的解决方案将是理想的。 我愿意使用任何技术。任何帮助将不胜感激。谢谢
【问题讨论】:
标签: node.js amazon-web-services web-scraping google-cloud-functions cloud