【发布时间】:2017-05-30 12:45:08
【问题描述】:
我有一个包含 HTML 的字符串,例如:
s <- "...<span class=\"pull-right\">170 cm</span>...
<span class=\"pull-right\">29</span>...
<span class=\"pull-right\">06/24/1987</span>..."
其中... 表示中间还有其他HTML 标签。我想提取>和</span>之间的信息,可以是
- 只有数字
- 数字和字符(大写或小写或两者兼有)
- 表格日期
mm/dd/yyyy
我想出了这样的正则表达式:
">[0-9/]*[a-z ]*[A-Z]*</span>"
这是正确的吗?如何提取感兴趣的值?也就是说,给定s:
170 cm
29
06/24/1987
【问题讨论】:
-
为什么不使用 XML 工具从 XML (HTML) 标签中提取数据?
-
那么,您对 HTML 抓取进行了哪些研究?这感觉很像“免费为我编写这段代码”。
-
@989 查看 BeautifulSoup4 以获得更高级的方法。
requests也很适合。