【发布时间】:2016-03-15 02:52:20
【问题描述】:
我每 5 分钟从 ElasticSearch 读取数据到 Spark。所以每5分钟会有一个RDD。
我希望基于这些 RDD 构建一个 DStream,这样我就可以得到最近 1 天、最近 1 小时、最近 5 分钟等数据的报告。
为了构建DStream,我正在考虑创建自己的接收器,但是spark的官方文档只提供了使用scala或java的信息。我使用python。
那么你知道有什么方法吗?我知道我们可以。毕竟 DStream 是一系列的 RDD,当然我们应该从连续的 RDD 中创建 DStream。我只是不知道怎么做。请给点建议
【问题讨论】:
标签: elasticsearch apache-spark pyspark