【发布时间】:2019-06-01 07:31:24
【问题描述】:
我有如下要求
- 有多个设备根据设备配置生成数据。例如,有两个设备以各自的时间间隔生成数据,假设 d1 每 15 分钟生成一次,d2 每 30 分钟生成一次
- 所有这些数据都将发送到 Kafka
- 我需要使用数据并根据当前小时生成的值和下一小时生成的第一个值对每个设备执行计算。例如,如果 d1 从上午 12:00 到凌晨 1:00 每 15 分钟生成一次数据,则计算基于该小时生成的值和从上午 1:00 到上午 2:00 生成的第一个值。如果该值不是从凌晨 1:00 到凌晨 2:00 产生的,那么我需要考虑从凌晨 12:00 到凌晨 1:00 的数据并将其保存为数据存储库(时间序列)
- 这样会有“n”个设备,每个设备都有自己的配置。在上述场景中,设备 d1 和 d2 每 1 小时生成一次数据。可能还有其他设备每 3 小时、6 小时生成一次数据。
目前这个要求是在 Java 中完成的。由于设备随着计算量的增加而增加,我想知道Spark/Spark Streaming是否可以应用于这种场景?任何关于这类需求的文章都可以分享,这样会有很大的帮助。
【问题讨论】:
标签: java apache-spark bigdata spark-streaming