【发布时间】:2019-08-31 01:37:07
【问题描述】:
有两个表如下:
CREATE TABLE model_vals (
model_id int,
data_item_code text,
date date,
data_item text,
pre_cal1 text,
pre_cal2 text,
pre_cal3 text,
pre_cal4 text,
pre_cal5 text,
pre_cal6 text,
PRIMARY KEY (( model_id, data_item ), date)
) WITH CLUSTERING ORDER BY ( date DESC )
CREATE TABLE prapre_calulated_vals (
id int,
precal_code text,
date date,
precal_item text,
pre_cal1 text,
pre_cal2 text,
pre_cal3 text,
pre_cal4 text,
pre_cal5 text,
pre_cal6 text,
PRIMARY KEY (( id, precal_item ), date)
) WITH CLUSTERING ORDER BY ( date DESC )
处理来自 Kafka 的输入数据后,使用 spark-sql 将结果数据插入到第一个 (model_vals) C* 表中。这进一步服务于一些网络服务端点。
另一个业务逻辑需要来自上面第一个(model_vals)C* 表的数据,处理它并在第二个(prapre_calulated_vals)C* 表中填充结果。
对于 web 服务端点,最终用户可以通过 require where 条件并从 first(model_vals) C* 表中获取数据。
但进一步处理我需要读取整个 first(model_vals) C* 表, 处理数据,进行其他计算并填充第二个 (prapre_calulated_vals) C* 表。
First(model_vals) C*表有百万条记录,所以我们不能一次加载整个表来处理..
如何在 C* 中处理这种情况?我有什么办法来处理这种情况?
【问题讨论】:
标签: nosql datastax cassandra-3.0 nosql-aggregation