【发布时间】:2013-08-05 01:47:40
【问题描述】:
我如何匹配下面的代码来获得两个字符串:
- 结束标签的第三个标题
- 第二个标题到第 6 个结束一个标签。(等等...第三个标题到第 9 个结束一个标签...等等)
这里是要匹配的字符串:
title
<a></a>
content here
<a></a>
text...
<a></a>
text...
title
<a></a>
<a></a>
<a></a>
我尝试使用 .* 但这捕获了从标题到最后一个标签的文本。
【问题讨论】:
-
我希望您没有使用正则表达式解析 HTML! stackoverflow.com/a/1732454/188
-
这是一个6层嵌套的锚元素吗?这个页面到底在做什么?
-
@Matthew,代码格式永远不会改变,所以我认为在这种情况下使用正则表达式解析 html 没有任何问题......
-
“永不改变”,直到它改变为止。我有时会使用正则表达式从 HTML 中提取数据,但通常启动适当的解析器并获取所需的位同样容易。
-
就像@MatthewSchinckel 说的那样,您可以使用诸如 beautifulSoup 或 lxml 包之类的东西更快地完成这项工作。