【发布时间】:2014-08-07 02:39:58
【问题描述】:
是否可以使用 selenium 浏览给定 URL(网站)的所有 URI?
我的目标是使用 selenium 和我选择的给定 URL 启动 firefox 浏览器(感谢这个网站,我知道该怎么做),然后让 firefox 浏览 URL(网站)拥有的所有页面。我感谢任何有关如何在 Python 中执行此操作的提示/帮助。
【问题讨论】:
-
您真的需要关注网站上的所有链接吗?动机是什么?您想从网站中获取什么样的数据?网站是否允许进行网络爬取?它提供 API 吗?指向不同域的外部链接呢?为什么需要真正的浏览器(selenium)?谢谢。
-
“浏览整个网站”在这里意味着什么?您是只寻找 HTML,还是需要 JavaScript、CSS、图像、字体和下载?您希望如何与 Python 中的这个“超级爬虫”进行交互?换句话说:你想在这里解决什么问题?
-
我相信 Selenium 不适合做这件事。 Selenium 旨在为您提供通过 UI 执行自动化测试的能力。如果您需要爬虫,请至少查看portent.com/blog/random/python-web-crawler-code.htm 或自己编写。
-
@olyv 但我的最终目标是让 firefox 在给定网站 (URL) 的所有页面 (URI) 中运行:您认为有比 selenium 更好的工具吗?跨度>
-
@begueradj 另一种方法是编写一些 javascript 代码,然后将其保存到书签中。
标签: python firefox selenium selenium-webdriver web-scraping