【发布时间】:2016-08-07 19:07:39
【问题描述】:
我对 selenium 的最大问题是浏览器的重新打开时间过长(每隔几分钟就使用它刮擦一次)。我也在使用代理并使用 python 的线程运行多个浏览器 - 每隔几分钟就会启动/停止(当新工作到来时)
线程也意味着只使用 1 个 CPU,性能会受到影响。
我一直在考虑开始使用 celery(开箱即用的多核支持)并使工作人员(不同的代理/浏览器)无限期地运行(while 循环),同时打开的 selenium 浏览器实例等待获取确切的 URL抓取 - 通过 redis 之类的东西提供数据。
用 celery 运行像这样的连续任务是个好主意吗?有没有更好的方法来做到这一点?
【问题讨论】: