【发布时间】:2022-04-04 12:47:00
【问题描述】:
我用 python 编写了一个爬虫,它可以访问 60 多个网站,解析 HTML,并将数据保存到数据库。
现在我使用 cron 作业每 15 分钟运行一次爬虫。问题是我无法确定爬虫需要多长时间才能完成(有时可能需要超过 15 分钟),如果一个已经在运行,我不想再运行另一个爬虫。
我一直想知道是否最好使用无限循环并使爬虫成为始终运行的永久进程(但我如何确保爬虫不会失败并退出?以及如何每次都重新启动它退出?)。
哪个效率更高?无限循环还是 cron 作业?
【问题讨论】:
标签: python cron web-crawler