【发布时间】:2014-06-26 20:11:29
【问题描述】:
我正在使用 lxml 来解析一些 xml。一些标签的 html 格式错误,导致 lxml 抛出错误。我们想跳过“Tag1”并能够解析文档的其余部分。我们尝试了以下方法,但仍然收到错误“lxml.etree.XMLSyntaxError: Opening and ending tag mismatch: b”:
s = '<?xml version="1.0" encoding="UTF-8"?><myroot><Tag1><b>this is some malformed</Tag1><Tag2>We will continue on</Tag2></myroot>'
xml = etree.fromstring(s)
etree.strip_elements(xml, 'Tag1')
print xml.find('.//Tag2').text
发生错误是因为我们解析文档然后尝试忽略 Tag1。有没有办法在我们解析lxml中的文档之前忽略Tag1?
谢谢!
【问题讨论】: