【问题标题】:regex Y-M-D extraction from web scraping从网络抓取中提取正则表达式 Y-M-D
【发布时间】:2022-11-17 11:52:03
【问题描述】:
我想从以下 html 中提取 Y-M-D 信息。
Created at</th><td><span><time datetime="2001-06-01"
date= [re.search("Created at</th><td><span><time datetime=([0-9A-Za-z\&;]*)", address).group(1)]
date
我试过这段代码,但它不起作用。你有什么想法吗?
【问题讨论】:
标签:
python
regex
screen-scraping
【解决方案1】:
re.search 中的第一个参数应该是模式,第二个参数是您要从中提取的字符串。
你可以开始尝试类似的东西:
re.search("d{4}-d{2}-d{2}", 'Created at</th><td><span><time datetime="2001-06-01"')
然后使用组
【解决方案2】:
尝试使用捕获组来隔离正则表达式模式的日期部分。
date = re.search(r'time datetime="(d{4}-d{2}-d{2})"', address)
print(date.groups())
输出:
('2001-06-01')