【发布时间】:2016-03-31 01:56:38
【问题描述】:
我正在尝试获取生成的网页内容,以便提取显示文本。我尝试了下面的代码,但它让我得到了源 html,而不是生成的 html。
string urlPath = "http://www.cbsnews.com/news/jamar-clark-protests-follow-decision-not-to-file-charges-in-minneapolis-police-shooting/";
WebClient client = new WebClient();
string str = client.DownloadString(urlPath);
将 str 变量中的文本与 Chrome 浏览器中开发者工具中的 html 进行比较,您会得到不同的结果。
我们将不胜感激。
【问题讨论】:
-
问题是......?
-
Chrome 解析 HTML 而不仅仅是检索它。这意味着处理特殊字符、换行符等。你到底想做什么?您所看到的可能更接近“查看页面源代码”edit 此外,在页面上执行的 javascript、加载的 iframe 等等都可以更改呈现的 html 与源代码,因此它可能永远不会无论如何都要准确
-
问题是“如何通过c#获取浏览器中显示的文本”。
-
我正在尝试提取显示的文本以供分析。上面的代码只给我 html 而不是实际的输出。那么,在所有 javascript 执行和其他事件发生后,我如何获取 html?