【发布时间】:2008-08-25 16:05:29
【问题描述】:
C#:解析超链接及其描述的好的正则表达式是什么?
请考虑不区分大小写、空格和在 HREF 标记周围使用单引号(而不是双引号)。
还请考虑获取在<a> 标签中包含其他标签的超链接,例如<b> 和<i>。
【问题讨论】:
C#:解析超链接及其描述的好的正则表达式是什么?
请考虑不区分大小写、空格和在 HREF 标记周围使用单引号(而不是双引号)。
还请考虑获取在<a> 标签中包含其他标签的超链接,例如<b> 和<i>。
【问题讨论】:
只要没有嵌套标签(并且没有换行符),以下变体就可以正常工作:
<a\s+href=(?:"([^"]+)"|'([^']+)').*?>(.*?)</a>
一旦嵌套标签开始发挥作用,正则表达式就不适合解析。但是,您仍然可以通过应用现代解释器的更高级功能(取决于您的正则表达式机器)来使用它们。例如。 .NET 正则表达式使用堆栈;我发现了这个:
(?:<a.*?href=[""'](?<url>.*?)[""'].*?>)(?<name>(?><a[^<]*>(?<DEPTH>)|</a>(?<-DEPTH>)|.)+)(?(DEPTH)(?!))(?:</a>)
来源:http://weblogs.asp.net/scottcate/archive/2004/12/13/281955.aspx
【讨论】:
从StackOverflow: Regular expression for parsing links from a webpage?查看这个例子
使用The HTML Agility Pack,您可以解析 html,并使用 HTML 的语义提取详细信息,而不是使用损坏的正则表达式。
【讨论】:
I found this 但显然these guys 遇到了一些问题。
编辑:(有效!)
我现在已经完成了自己的测试,发现它可以工作,我不懂 C#,所以我不能给你一个 C# 的答案,但我知道 PHP,这是我从运行它得到的匹配数组:
<a href="pages/index.php" title="the title">Text</a>
array(3) { [0]=> string(52) "Text" [1]=> string(15) "pages/index.php" [2]=> string(4) "Text" }
【讨论】:
我have a regex 处理大多数情况,但我相信它确实匹配多行注释中的 HTML。
它是使用 .NET 语法编写的,但应该很容易翻译。
【讨论】:
既然我已经开始工作了,就要把这个 sn-p 扔出去。这是一个较早前建议的不那么贪婪的版本。如果输入有多个超链接,原始文件将不起作用。下面的代码将允许您遍历所有超链接:
static Regex rHref = new Regex(@"<a.*?href=[""'](?<url>[^""^']+[.]*?)[""'].*?>(?<keywords>[^<]+[.]*?)</a>", RegexOptions.IgnoreCase | RegexOptions.Compiled);
public void ParseHyperlinks(string html)
{
MatchCollection mcHref = rHref.Matches(html);
foreach (Match m in mcHref)
AddKeywordLink(m.Groups["keywords"].Value, m.Groups["url"].Value);
}
【讨论】:
这是一个匹配平衡标签的正则表达式。
(?:""'[""'].*?>)(?(?>(?)|(?)|.)+)(?(DEPTH)(?!)) (?:)
【讨论】: