【发布时间】:2019-03-01 14:36:21
【问题描述】:
我有下面的正则表达式来识别 html 标记中的文本,它不会产生预期的结果。
HTML 标签:
<td>Issue Amount</td>
<td>:</td>
<td>20,000,000.00</td>
Find = re.findall(?<=Issue Amount</td> <td>:</td> <td>) [0-9,]),soup_string)[0]
我需要从这个标签中获取数值 20,000,000.00。
任何建议我在这里做错了什么。我确实尝试了其他几种方法,但都没有成功。
【问题讨论】:
-
试试这个正则表达式
([\d,.]+)[\d,.]+ :任何数字或逗号或点 () 的一次或多次:捕获组 -
感谢 nissim.. 它可以工作,但这只是 html 正文的一部分,它也有可能最终匹配其他值。在整个正文中,正则表达式应该只匹配这部分。
标签: regex python-3.x regex-lookarounds