【问题标题】:How to crawl a feed如何抓取提要
【发布时间】:2010-10-16 02:09:24
【问题描述】:

我的应用程序需要跟踪 RSS/Atom 提要并将新条目保存在数据库中。我的问题是,确定提要中的条目是否已被抓取的最可靠方法是什么?

我使用Universal Feed Parser 模块来解析提要。我当前的实现会记录feed.entry[i].updated_parsed 的最新值,当抓取时,如果条目的updated_parsed 值大于记录的值,则将该条目保存在数据库中。这里的问题是许多提要没有发布日期或更新日期。

【问题讨论】:

    标签: rss web-crawler feed atom-feed


    【解决方案1】:

    您应该主要通过引用其<guid> 来确定您是否已经抓取了一个条目(在没有<guid> 的情况下回退到<link>),并且与日期有关的任何事情仅作为次要分析。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-03-04
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-12-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多