【发布时间】:2018-12-16 09:10:23
【问题描述】:
我使用python 结合re 模块编写了一个脚本来解析网页中的一些内容。我希望解析的内容:其中一些有空格,而另一些则没有。我怎样才能将它们全部包含在一个模式中。我试过的只能抓住周围有空格的。我使用了积极的后视和积极的前瞻来获得它们。
我想使用正则表达式从下面的html elements 中获取文本asked。
import re
content = """
<div class="user-action-time">
asked <span title="2018-07-08 09:43:08Z" class="relativetime">2 hours ago</span>
</div>
<div class="user-action-time">asked<span title="2018-07-07 17:17:07Z" class="relativetime">18 hours ago</span>
</div>
<div class="user-action-time">
asked <span title="2018-07-06 20:35:48Z" class="relativetime">yesterday</span>
</div>
"""
pattern = re.compile(r'(?<=user-action-time">\s)(.*)(?=<span)')
for item in pattern.finditer(content):
print(item.group())
【问题讨论】:
标签: python regex python-3.x web-scraping