【问题标题】:dealing with html source vs browser dom处理 html 源 vs 浏览器 dom
【发布时间】:2012-07-23 00:41:51
【问题描述】:

我正在使用 nokogiri 在 ruby​​ 中构建一个爬虫,我注意到有时通过解析源创建的 dom 和浏览器解析源时创建的 dom 是不同的。

例如浏览器添加了tbody标签,如果文档格式不正确或者javascript在运行时发生变化,浏览器可以修改标签。

问题是我从浏览器 dom 获取所需的元素路径(在此阶段使用元素检查器)但是当我通过解析源在 dom 中搜索该元素时,由于这些差异,没有找到任何内容。

是否有可能获得与浏览器相同的dom,如果可以,如何获得?

【问题讨论】:

    标签: ruby html-parsing


    【解决方案1】:

    您可以使用浏览器并从渲染的源中获取 dom。有几个驱动程序,如 selenium、webkit-headless、poltergeist 等,可以驱动无头浏览器或真正的浏览器。

    所有浏览器可能会呈现不同的版本,因为没有官方标准实现,所以您需要找到最适合您的版本。

    【讨论】:

      猜你喜欢
      • 2013-03-13
      • 2018-12-25
      • 1970-01-01
      • 1970-01-01
      • 2012-11-01
      • 2021-07-04
      • 1970-01-01
      • 2016-03-14
      • 1970-01-01
      相关资源
      最近更新 更多