【发布时间】:2016-05-21 14:34:43
【问题描述】:
假设我有这样的xml(真实的更复杂):
<a>
<b>
<c replace="alpha" />
</b>
<d>
<c replace="beta"></c>
</d>
</a>
自从我can't use regex 以来,我已经用 BeautifulSoup (lxml) 解析了这个。现在我将<c> 替换为包含取决于属性的新有效xml 的字符串。这并不难。
但是我想这样做而不用 BeautifulSoup 解析新的 xml。原因是我只是要在之后美化它。有相当多的标签被大量的 xml 替换。它不是非常高效的解析然后美化所有内容。
有类似LiteralXmlPleaseDontParseThisTnx 节点的东西吗? (我找不到它,他们一定把它叫做别的东西,而且有太多不相关的命中,“原始 html”、“未解析的 html”、“文字 hmtl”......)。
或者,有没有办法美化上面的 xml,然后将新的 xml 作为纯文本插入其中(不对 xml 做任何假设)?
【问题讨论】:
-
看看lxml。也许它可以帮助你。
标签: python xml xml-parsing beautifulsoup