【发布时间】:2012-12-30 18:21:17
【问题描述】:
可能重复:
Parsing web pages
我正在尝试用 C# 解析网页的内容。这是我使用的代码:
WebRequest request = WebRequest.Create("URL");
WebResponse response = request.GetResponse();
Stream data = response.GetResponseStream();
string html = String.Empty;
using (StreamReader sr = new StreamReader(data))
{
html = sr.ReadToEnd();
}
但问题是我得到了 html 包含的所有数据。
对于如何以“干净”的方式获取有用的数据,或者我必须构建自己的解析器,您有什么建议吗?例如:包含标题和与之相关的文本的帖子,类似博客的格式。
【问题讨论】:
-
什么是“有用信息”?您必须自己解析响应。
-
有用的是页面包含的实际信息,没有隐藏标签或其他数据。
-
Html Agility Pack 非常适合这类东西。去读一读,然后玩,如果你有任何具体问题再回来
-
您需要使用正则表达式类来忽略您不需要的部分。实际上,您需要自己构建它!
-
@Mohsenr1:正则表达式不适用于解析 html!
标签: c# html-parsing webpage