【问题标题】:How can I find feed or XML of a particular news source如何找到特定新闻源的提要或 XML
【发布时间】:2011-10-17 23:54:57
【问题描述】:

我想获取特定新闻源的 xml 文件,如果有任何项目将 html 新闻转换为 xml,解析页面并标记其各种特征,如日期、作者姓名、标题、内容等。 xml 或类似类型的文件。 例如看这个链接: http://daily.bhaskar.com/article/NAT-TOP-yeddyurappa-breaks-venkaiah-naidus-laptop-slaps-minister-reports-2318460.html 如何从该网页中提取内容、作者、日期等。或者,如果我能找到这个网页的提要,我可以轻松地做到这一点。但是我该如何搜索呢。

【问题讨论】:

    标签: rss html-content-extraction


    【解决方案1】:

    您使用的是哪种技术?

    如果它是一个纯粹的客户端/Web 解决方案,那么你会发现 js 选项in a previous StackOverflow question。如果你在服务器端,你可以use WebClient/LINQ to hit the ATOM feed and parse it

    【讨论】:

      【解决方案2】:

      要了解页面是否有提要,请扫描 HTML 以查找具有这些 reltype 属性的特定 标签:

      <link rel="alternate" type="application/rss+xml" title="Page as RSS"
       href="http://example.com/page/feed">
      

      Feed URL 存储在 href 属性中。这种机制称为RSS Autodiscovery

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2011-09-13
        • 1970-01-01
        • 1970-01-01
        • 2018-07-07
        • 1970-01-01
        相关资源
        最近更新 更多