【发布时间】:2015-05-28 00:04:49
【问题描述】:
我正在尝试从 HTML 不一致的网页中收集信息,例如:
<ul><li>Item #1</li></ul><ul><li>sub Item #1</li></ul>
没关系,我使用 XPath 表达式
//div[@id="content"]/ul/li/text()
它完成了这项工作(除了不从子项目 #1 收集信息。,
HTML 也有所不同,这是另一种方式:
<dl><dd><ul><li>Item #1</li></ul></dd></dl><dl><dd><ul><li>sub Item #1</li></ul></dd></dl>
嗯,我正在尝试收集项目 #1 和子项目 #1。但是由于这种不一致的 HTML,我无法找到一个 XPath 表达式来让我在任何情况下都可以收集信息,你能帮我解决这个问题吗?
总会有一个列表,项目#1 和子项目#1 总是在<ul><li> 内
【问题讨论】:
-
您是如何获得 HTML 的?你能给我们一个源链接吗?
-
是的@LegoStormtroopr 我正在尝试这两个页面:es.wikiquote.org/wiki/Los_Simpson 和 es.wikiquote.org/wiki/Friends