【问题标题】:How to extract certain strings start with a symbol from a text file in python?如何从python中的文本文件中提取某些以符号开头的字符串?
【发布时间】:2013-08-18 13:04:56
【问题描述】:

如何从文本文件中提取以符号“$”开头的所有单词?

文件 a (ascii) -->

        @ExtendedAttr = nvp_add(@ExtendedAttr, "severity", $severity,  
 "description", $description, "eventID", $eventID,
             "eventURL", $eventURL, "alertLevel", $alertLevel, 
      "eventStart", $eventStart,
             "eventSourceCount", $eventSourceCount, "eventSourceTable", 
$eventSourceTable, "eventDestCount", $eventDestCount)

我希望输出是这样的(全部在新行中):

$severity
$description
$eventID
$eventURL
$alertLevel
$eventStart
$eventSourceCount
$eventSourceTable
$eventDestCount

【问题讨论】:

    标签: python string extract symbols


    【解决方案1】:

    使用regex:

    >>> import re
    >>> with open('filename') as f:
    ...     ans = []
    ...     for line in f:
    ...         matches = re.findall(r'(?<!\w)(\$\w+)', line)
    ...         ans.extend(matches)
    ...         
    >>> print ans
    ['$severity', '$description', '$eventID', '$eventURL', '$alertLevel', '$eventStart', '$eventSourceCount', '$eventSourceTable', '$eventDestCount']
    

    现在使用str.join 得到预期的输出:

    >>> print "\n".join(ans)
    $severity
    $description
    $eventID
    $eventURL
    $alertLevel
    $eventStart
    $eventSourceCount
    $eventSourceTable
    $eventDestCount
    

    【讨论】:

    • 如果我有如下文字:
    【解决方案2】:

    使用正则表达式,注意$(通常是行尾)与\ 的转义。使用f.read() 一次读取整个文件(也可以将其提取到另一行以增强可读性)

    import re
    
    with open("filename", "r") as f:
    ...     matches = re.findall("(\$\w+)", f.read())
    print matches
    

    【讨论】:

    • 这也将匹配 'foo$bar' 并且一次读取整个文件通常不是一个好主意。
    猜你喜欢
    • 1970-01-01
    • 2014-01-16
    • 1970-01-01
    • 2019-12-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多