【发布时间】:2013-08-07 11:58:42
【问题描述】:
所以我正在尝试构建一个网络爬虫。我已经开始传递请求并获取页面的所有 HTML 作为响应。
接下来我想到了使用正则表达式从 HTML 页面中提取链接。然而,我越是尝试学习它们,它们看起来就越棘手。
有没有正则表达式的替代品(这似乎是一个讨论问题,但不是我已经搜索了互联网并没有找到满意的答案)。
【问题讨论】:
-
你想要 HTML 实用程序包htmlagilitypack.codeplex.com