【问题标题】:Fast way of getting a page source [duplicate]获取页面源的快速方法[重复]
【发布时间】:2019-06-17 13:52:45
【问题描述】:

我目前正在使用 Selenium 打开和检索 url 列表的页面源。然而,Selenium 对每个 url 花费的时间太长,我计划将此脚本用于(至少)几百个 url。谁能建议一种更快的方法来获取给定 url 的页面源(可能使用 php?)?

请附上您的建议代码。提前致谢。

browser.get(url)
body = browser.page_source

【问题讨论】:

  • @BramVanroy urllib2 是否允许您访问 html 代码以便可以用漂亮的汤来解析它?

标签: python html


【解决方案1】:

我是菜鸟。

但我认为请求可能会更快,其次是无头浏览器(Selenium,但不打开 GUI),最后是常规 Selenium。我的想法基于每种方法可能使用的资源。

不幸的是我找不到任何关于这些方法之间差异的文章,但是这里有一篇似乎涵盖了chrome无头浏览器的文章:https://intoli.com/blog/running-selenium-with-headless-chrome/

【讨论】:

  • 我没有使用 GUI。我只想要来源。
  • 您应该使用请求,看看它有多快。如果您使用的是 Selenium,那么您很可能使用的是 GUI。
猜你喜欢
  • 2012-08-08
  • 2013-04-02
  • 2019-10-04
  • 2021-02-11
  • 1970-01-01
  • 2017-05-07
  • 1970-01-01
  • 2016-07-06
  • 1970-01-01
相关资源
最近更新 更多