【发布时间】:2011-05-28 21:27:50
【问题描述】:
我正在使用 HtmlCleaner2.1 库来评估由 XPather 插件生成的 xpath 与 html 的对比,以从中抓取内容。但有时,HtmlCleaner 无法评估 xpath。
例如 http://www.megaoutdoors.co.uk/norwegen-army-shirt-zipped-roll-top-collar-278-p.asp
对于产品标题,XPather 给出的 xpath 为 //body/div[11]/div[6]/div[2]/form/div[1]/h1 但是当我使用 HtmlCleaner 评估它时,这会失败。
我们怎样才能克服这个问题。 htmlcleaner清理时页面结构会改变吗?
谢谢
日腾德拉
【问题讨论】:
-
@Jitendra:对于声称 XHTML 验证不是格式良好的 XML 的文档,通常不是一个好的设计选择。
-
以什么方式失败? (例如错误消息、获取错误数据、没有获取数据……)
-
@Alejandro,这些网站不是我们的,但我们有权抓取它们。所以无论如何我们都必须刮掉它们。
-
@LarsH,从某种意义上说,在评估上述 xpath 时,它给出了 0 个节点。
-
@Jitendra:还要注意浏览器构建的 DOM 可能与其他解析器构建的 DOM 不同(匿名元素、强制 TBODY、相邻文本节点等)
标签: java html xpath htmlcleaner