【问题标题】:How to obtain multiple tuples using pythons findall如何使用 python findall 获取多个元组
【发布时间】:2017-12-26 15:50:29
【问题描述】:

我正在尝试使用 python findall() 从以下“文本”中获取多个元组

text = '[szur formatter] line 1<?xml version="1.0"?><star>[szur parser] line 2<?xml version="1.0"?><Planet>'

我想从'text'中获取以下匹配模式

    Match 1
    [szur formatter] line 1 
    <?xml version="1.0"?><star>

    Match 2
    [szur parser] line 2
    <?xml version="1.0"?><Planet> 

我正在尝试使用此正则表达式对 findall 进行此操作

re.findall(r'\[(szur.*?[^<])(<.*>+)', text)

这会产生

[('szur formatter] line 1', '<?xml version="1.0"?><star>[szur parser] line 2<?xml version="1.0"?><Planet>')]

如何获得预期的结果。我的正则表达式不会产生第二个元组。我需要如何修改我的正则表达式才能获得这个?任何指针将不胜感激。

【问题讨论】:

标签: python regex findall


【解决方案1】:

这是一个做出一些假设的正则表达式:

>>> re.findall(r"(\[szur.*?[^\]]\] line \d*)([^\[]*)", text)
[('[szur formatter] line 1', '<?xml version="1.0"?><star>'), 
 ('[szur parser] line 2',    '<?xml version="1.0"?><Planet>')]

但是说真的,伙计,如果您发现自己使用正则表达式解析 XML 和非 XML 的混合体,请问自己:“我是怎么到这里的?”

【讨论】:

    【解决方案2】:

    我想知道这是否是一个好主意(即使用正则表达式),但你去吧:

    \[szur[^][]*\].*?<\w+>
    

    使用DOTALL 修饰符并查看a demo on regex101.com


    Python
    import re
    
    string = """[szur formatter] line 1<?xml version="1.0"?><star>[szur parser] line 2<?xml version="1.0"?><Planet>"""
    
    rx = re.compile(r'(\[szur[^][]*\].*?<\w+>)')
    
    matches = rx.findall(string)
    # matches = rx.findall(string, re.DOTALL)
    print(matches)
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2016-04-29
      • 1970-01-01
      • 1970-01-01
      • 2014-01-31
      • 2021-11-27
      • 2017-08-12
      • 1970-01-01
      • 2022-06-10
      相关资源
      最近更新 更多