【问题标题】:regex Y-M-D extraction from web scraping从网络抓取中提取正则表达式 Y-M-D
【发布时间】:2022-11-17 11:52:03
【问题描述】:

我想从以下 html 中提取 Y-M-D 信息。

Created at</th><td><span><time datetime="2001-06-01"
date= [re.search("Created at</th><td><span><time datetime=([0-9A-Za-z\&;]*)", address).group(1)]
date

我试过这段代码,但它不起作用。你有什么想法吗?

【问题讨论】:

    标签: python regex screen-scraping


    【解决方案1】:

    re.search 中的第一个参数应该是模式,第二个参数是您要从中提取的字符串。

    你可以开始尝试类似的东西:

    re.search("d{4}-d{2}-d{2}", 'Created at&lt;/th&gt;&lt;td&gt;&lt;span&gt;&lt;time datetime="2001-06-01"')

    然后使用组

    【讨论】:

      【解决方案2】:

      尝试使用捕获组来隔离正则表达式模式的日期部分。

      date = re.search(r'time datetime="(d{4}-d{2}-d{2})"', address)
      print(date.groups())
      

      输出:

      ('2001-06-01')
      

      【讨论】:

        猜你喜欢
        • 2015-09-05
        • 1970-01-01
        • 2020-09-28
        • 1970-01-01
        • 2013-07-30
        • 1970-01-01
        • 2016-10-13
        • 1970-01-01
        • 2011-09-27
        相关资源
        最近更新 更多