【发布时间】:2012-07-23 00:41:51
【问题描述】:
我正在使用 nokogiri 在 ruby 中构建一个爬虫,我注意到有时通过解析源创建的 dom 和浏览器解析源时创建的 dom 是不同的。
例如浏览器添加了tbody标签,如果文档格式不正确或者javascript在运行时发生变化,浏览器可以修改标签。
问题是我从浏览器 dom 获取所需的元素路径(在此阶段使用元素检查器)但是当我通过解析源在 dom 中搜索该元素时,由于这些差异,没有找到任何内容。
是否有可能获得与浏览器相同的dom,如果可以,如何获得?
【问题讨论】:
标签: ruby html-parsing