【发布时间】:2021-01-29 06:55:28
【问题描述】:
我正在处理的文档只包含一定深度的有效 xml,一旦达到该深度,可能会有无效的 xml,但是可以确定在无效文本中不会出现之前的 xml 标记。 (我猜可以假设里面有二进制文件)
因此,我只需要将文档解析到一定深度,其余部分应作为文本处理,即使它可能包含其他标签。
用 lxml 可以吗,写我自己的词法分析器肯定是矫枉过正
【问题讨论】:
-
您可以编辑您的问题并添加一个简短的 xml 示例以及您的预期输出吗?
标签: python-3.x lxml