【发布时间】:2011-08-25 04:22:27
【问题描述】:
我正在使用lxml 来解析 HTML:
>>> from lxml.html import fromstring, tostring
在某些情况下它会正确解析尾随空格:
>>> html = """<div>some <i>text</i> </div>"""
>>> html == tostring(fromstring(html))
True
但是在遇到未知标签(比如下面的blah标签)的时候好像会断掉。
>>> html = """<div>some <blah>text</blah> </div>"""
>>> html == tostring(fromstring(html))
False
如何修复它以包含所有标签的尾随空格?
【问题讨论】:
标签: python html xml parsing lxml