【问题标题】:Parsing an XML with unknown and variable tags into a readable format将带有未知和可变标签的 XML 解析为可读格式
【发布时间】:2019-12-05 06:22:58
【问题描述】:

我有一个网页的 XML,它有不同的格式和嵌套表。我无法解析 XML 以提供可读的输出。

我试图使用 ElementTree 库来完成任务,但在获得可读且格式良好的结果方面没有取得任何进展。 XML 看起来像这样:

<?xml-stylesheet type="text/xsl" href="/universal_parse.xsl"?><AgentXmppConnectionStatus type="sandesh"><peer identifier="1" type="list"><list size="1" type="struct"><AgentXmppData><controller_ip identifi
er="1" type="string">192.168.100.2</controller_ip><state identifier="2" type="string">Established</state><peer_name identifier="3"> <peer_addres
s identifier="4" type="string">192.168.100.2:5269</peer_address><cfg_controller identifier="5" type="string">Yes</cfg_controller><mcast_controller identifier="6" type="string">Yes</mcast_controller><last_
state identifier="7" type="string">

实际网页的结果格式类似于this 以及其他不同的格式。 所以我正在寻找一个 Python 脚本,它接受 XML 并以一种可读的格式提供输出,并且类似于它在网页上的实际显示方式。

(PS:这是我第一次问Stack Overflow问题,请原谅我这边的任何错误)

【问题讨论】:

  • 野兔斯里尼瓦萨。如果您需要代码美化器,可以在线获取:codebeautify.org/xmlviewer。如果你想要一个 xml 渲染器,你需要有一个好的 css 文件。我不确定你在问什么。
  • 您的 xml 无效。
  • “可读”这个词是主观的。如果要处理任意 XML,则很难设计出比 XML 本身更具可读性的显示格式。如果您认为您可以设计出一种比词法 XML 更具可读性的格式,请告诉我们它是什么,我们可以帮助您生成它。

标签: xml python-2.7 beautifulsoup elementtree


【解决方案1】:

您可以使用 BeautifulSoup 解析此 XML。这可以给你一个想法:

data = '''<?xml-stylesheet type="text/xsl" href="/universal_parse.xsl"?><AgentXmppConnectionStatus type="sandesh"><peer identifier="1" type="list"><list size="1" type="struct"><AgentXmppData><controller_ip identifi
er="1" type="string">192.168.100.2</controller_ip><state identifier="2" type="string">Established</state><peer_name identifier="3"> <peer_addres
s identifier="4" type="string">192.168.100.2:5269</peer_address><cfg_controller identifier="5" type="string">Yes</cfg_controller><mcast_controller identifier="6" type="string">Yes</mcast_controller><last_
state identifier="7" type="string">'''

from bs4 import BeautifulSoup

soup = BeautifulSoup(data, 'html.parser')

print('{: <20}{}'.format('cfg_controller:', soup.select_one('agentxmppconnectionstatus ~ cfg_controller').text))
print('{: <20}{}'.format('mcast_controller:', soup.select_one('agentxmppconnectionstatus ~ mcast_controller').text))
print()
print('{: <20}{: <20}{: <20}'.format('controller_ip', 'state', 'peer_name'))
for row in zip(soup.select('peer agentxmppdata controller_ip'),
               soup.select('peer agentxmppdata state'),
               soup.select('peer agentxmppdata peer_name')):
    print('{: <20}{: <20}{: <20}'.format(*[d.text.strip() for d in row]))

# print(soup.prettify())  <--- uncomment this line for pretty print the whole XML

打印:

cfg_controller:     Yes
mcast_controller:   Yes

controller_ip       state               peer_name           
192.168.100.2       Established         192.168.100.2:5269  

【讨论】:

  • 非常感谢您的解决方案,但问题是我事先不知道标签。我每次都得到带有不同标签的不同 xml,脚本应该能够解析任何 xml它得到了。至少如果不是确切的格式,它应该能够显示特定标题下的所有值(在某种意义上它应该正确识别和显示父子关系)。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2015-02-05
  • 2016-05-22
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多