【问题标题】:How to use HTML Parser to fetch comments? [closed]如何使用 HTML Parser 获取评论? [关闭]
【发布时间】:2012-10-17 14:52:34
【问题描述】:

我正在尝试使用ASP.NET 中的HTML 解析器和C# 从新闻网站Times of India 上的文章中解析/获取cmets。这是一个示例网址:http://timesofindia.indiatimes.com/tech/tech-news/software-services/Infosys-CEO-SD-Shibulals-letter-to-employees/articleshow/16832881.cms

我尝试获取它的 HTML,然后使用WebGetDocumentNode.SelectNodes() 等来获取 cmets。但它没有在 Page 的 HTML 中显示任何 cmets。

(通常所有要获取的数据都嵌入在一些<div>标签等中,但这里没有提供cmets的此类标签。)

如何从该页面获取 cmets?

【问题讨论】:

  • 这可能会有所帮助:htmlagilitypack.codeplex.com 它使得从 html 中解析特定信息变得非常容易。
  • 你有没有实际 cmets 的 url,你帖子中的 url 没有 cmets?可能,cmets 在站点上动态更新。这就是为什么如果你获取 html 代码,它没有 cmets。
  • 您无法使用 HtmlAgilityPack 获取 cmets,因为它们是使用 JavaScript 加载的(您必须先运行 JS)。

标签: c# asp.net html html-parsing blogs


【解决方案1】:

如果您发布的 URL 是,您可以通过导航到 cmets URL 来获取 cmets。

http://timesofindia.indiatimes.com/tech/tech-news/software-services/Infosys-CEO-SD-Shibulals-letter-to-employees/opinions/16832881.cms

然后搜索

<div style="" class="cmt">

这似乎是指定 cmets 的标签。

【讨论】:

  • 你在这里说的很明显。
  • 谢谢...这就是我要找的。刚刚错过了。
  • @Nacereddine -- 有时显而易见的是所有人都需要
猜你喜欢
  • 2012-08-12
  • 1970-01-01
  • 2014-09-11
  • 1970-01-01
  • 1970-01-01
  • 2012-03-18
  • 2023-03-29
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多