【发布时间】:2013-11-21 09:03:38
【问题描述】:
这是一个示例
<tr>
<td>
<div class="VBChap"></div>
<a href="/testing/1">Sample Textbook Chapter 1</a> : Introduction to VB.net
</td>
<td>09/24/2013</td>
</tr>
文档基本上由这些反复重复的条目组成
我想提取以下内容:
- href=". 之后的部分 URL
- 章节正文
- 章节名称
- 日期
目前我正在使用两个单独的查询来获取数据
查询一:
(?<=^|>)[^><]+?(?=<|$)
这会提取 2、3 和 4。
查询 2:
(?<=<a href=")[^"]+
这会提取 1。
我想要一个可以提取所有四个的查询。
Regex 是我不擅长的。我花了 2 个小时的反复试验才得到这个。
【问题讨论】:
-
为此使用 HTML AgilityPack,不要使用正则表达式。