【发布时间】:2013-12-20 08:16:52
【问题描述】:
我个人需要抓取/自动访问我的linkedin 帐户(复制我的联系人等),显然该网站太 ajaxy 无法仅使用 wget、urllib 等。
我不能使用 LinkedIn API,因为它恰好限制了我感兴趣的一些用例。
我精通 Python 和 Javascript。我过去曾在小型抓取项目中使用过 webdriver,但在很久以前,重新学习它与学习 phantomjs 可能存在类似的开销。
我不打算运行任何类型的大容量基于集群的抓取操作,这一切都将在我的本地机器上以适当的速率限制运行,以免惹恼linkedin。这主要是为了个人方便、自动化等。
我听说过有关 phantomjs 的好消息,但我想了解它与 webdriver 相比有什么优势(反之亦然)。我猜 phantomjs 是“无头的”,这意味着它实际上不必运行浏览器,我想这可以更轻松地编写命令行脚本或消耗更少的资源或其他一些我想向我解释的属性!
我可以理解网络抓取程序应该是 javascript 的论点,因为这更像是一种浏览器原生语言,但我很想知道这是否是人们使用 phantomjs(或其表亲之一)的主要原因
【问题讨论】:
-
只是让你知道,我正在使用无头硒..
标签: selenium webdriver web-scraping phantomjs