【发布时间】:2012-10-17 14:52:34
【问题描述】:
我正在尝试使用ASP.NET 中的HTML 解析器和C# 从新闻网站Times of India 上的文章中解析/获取cmets。这是一个示例网址:http://timesofindia.indiatimes.com/tech/tech-news/software-services/Infosys-CEO-SD-Shibulals-letter-to-employees/articleshow/16832881.cms
我尝试获取它的 HTML,然后使用WebGet、DocumentNode.SelectNodes() 等来获取 cmets。但它没有在 Page 的 HTML 中显示任何 cmets。
(通常所有要获取的数据都嵌入在一些<div>标签等中,但这里没有提供cmets的此类标签。)
如何从该页面获取 cmets?
【问题讨论】:
-
这可能会有所帮助:htmlagilitypack.codeplex.com 它使得从 html 中解析特定信息变得非常容易。
-
你有没有实际 cmets 的 url,你帖子中的 url 没有 cmets?可能,cmets 在站点上动态更新。这就是为什么如果你获取 html 代码,它没有 cmets。
-
您无法使用 HtmlAgilityPack 获取 cmets,因为它们是使用 JavaScript 加载的(您必须先运行 JS)。
标签: c# asp.net html html-parsing blogs