【问题标题】:How to consume streaming XML (RSS feeds) with R?如何使用 R 使用流式 XML(RSS 提要)?
【发布时间】:2015-01-05 00:53:13
【问题描述】:

我有点了解如何使用XML 包来读取和解析XML 文件,例如RSS 提要的一部分。但是,连续阅读 RSS 提要的基本设置是什么?

例如,假设我想建立一个设施,从http://evemaps.dotlan.net/feed/sovereignty 连续读取提要并将数据存储在某种 R 数据结构中(例如,data.frame)。我想我需要执行以下操作:

  1. 在服务器上设置 R(例如 AWS 实例上的 RStudio Server)
  2. 打开到 rss 源的 HTTP 连接
  3. 不断读取和解析提要的不同位,并将它们添加到 data.frame,该 data.frame 会随着添加的每个条目而增长

不过,这还是一张比较模糊的图片。我需要将哪些基本包和功能串在一起才能完成这项工作?含义:创建这样一个设施需要采取哪些基本步骤?我不是在寻找任何人为我编写这个工具(即使那会很好!)。相反,我试图了解所涉及的总体步骤。

【问题讨论】:

    标签: xml r rss


    【解决方案1】:

    我想你正在寻找

    使用 RSS 客户端(即 AWS 上的 R 应用程序),您有 2 个选择:轮询或 PubSubHubbub(又名 webhooks、PuSH 等)。如here 所述,通过轮询,您可能会在超出某些发布者的最大 ping 策略后受到限制。使用 PuSH,发布者的服务器会在有新更新时实时通知您的 R 应用程序,因为它作为订阅工作。

    上面链接的 SO 答案指向流行的按需付费中心提供商 Superfeedr 和 a post 的博客,该博客描述了 PuSH 协议的工作流程并显示了命令行实现。

    您可以从this Google IO 2010 presentation 那里了解更多关于该协议的信息,作者是制作 PuSH 的工程师之一。

    【讨论】:

      猜你喜欢
      • 2012-11-08
      • 1970-01-01
      • 1970-01-01
      • 2011-03-09
      • 2016-01-17
      • 1970-01-01
      • 1970-01-01
      • 2011-04-09
      • 2020-06-08
      相关资源
      最近更新 更多