【发布时间】:2016-09-19 09:58:24
【问题描述】:
我在 Cassandra 表中存储了来自多个传感器的时间序列。这是我用于存储数据的架构:
CREATE TABLE data_sensors (
sensor_id int,
time timestamp,
value float,
PRIMARY KEY ((sensor_id), time)
);
例如,值可以是温度或压力,具体取决于它来自的传感器。
我的目标是能够找到压力的基本统计数据(最小值、最大值、平均值、标准),但前提是温度高于某个值。 这是我想要获得的整个过程的模式。
我认为如果我更改 Cassandra 模型(至少对于温度数据)能够过滤值会更好。在将数据导入 Spark RDD 之后,还有其他方法可以避免更改 Cassandra 表吗?
那么,一旦温度过滤完成,如何获得我必须用来过滤压力数据的时间戳序列?请注意,温度和压力的时间戳不一定相同,这就是为什么我认为我需要有时间段而不是精确时间戳列表的原因。
感谢您的帮助!
【问题讨论】:
标签: apache-spark cassandra time-series