【发布时间】:2022-01-05 01:33:56
【问题描述】:
我想在一些 .org 网站上运行一个涉及使用 beautifulsoup 24/7 进行网页抓取的 python 进程。它在大多数网站上运行平稳,但是,对于一些罕见的例外,网络中存在峰值,如下图所示。 python 进程(不是实例)被杀死。
在抓取时,我避免使用任何 .pdf 或 .jpg...,这样 CPU 使用率就不会超过 15%(到目前为止,没有问题)
理想情况下,我需要一个脚本来让进程在被杀死时重新启动,但有人告诉我这是不可能的(除非你们中的一些人建议我否则,也许我可以配置一个 AWS 服务来让进程在被杀死时重新启动被杀)。
有没有办法限制 beautifoulsoup 网络的能力,并在特定链接达到网络峰值之前停止对其进行抓取?
【问题讨论】:
标签: python amazon-web-services amazon-ec2 beautifulsoup