【发布时间】:2011-01-17 19:02:07
【问题描述】:
我有这个 HTML 代码,它在一行中:
<h3 class='r'><a href="www.google.com">fkdsafjldsajl</a></h3><h3 class='r'><a href="www.google.com">fkdsafjldsajl</a></h3>
这是行友好的版本(我不能使用)
<h3 class='r'><a href="www.google.com">fkdsafjldsajl</a></h3>
<h3 class='r'><a href="www.google.com">fkdsafjldsajl</a></h3>
我正在尝试使用此 REGEX 仅提取 URL
/<h3 class="r"><a href="(.*)">(.*)<\/a>/
然后它返回
www.google.com">fkdsafjldsajl</a></h3><h3 class='r'><a href="www.google.com"
找到 " 时我该怎么做才能阻止它?
【问题讨论】:
-
使用正则表达式解析 HTML 时要非常小心。即使在简单的 HTML 中,您也可能会遇到一个弄乱正则表达式的 URL。
标签: ruby regex web-crawler