【发布时间】:2020-02-13 14:53:22
【问题描述】:
我有以下数据管道:
- 一个进程向 Kafka 写入消息
- Spark 结构化流应用程序正在侦听新的 Kafka 消息并将它们原样写入 HDFS
- 批处理 Hive 作业每小时运行一次,并从 HDFS 读取新摄取的消息,并通过一些中等复杂的 INSERT INTO 语句填充一些表(我没有可用的物化视图)。 编辑:基本上在我的 Hive 工作之后,我有 Table1 存储原始数据,然后是另一个表 Table2 = fun1(Table1),然后 Table1 em>Table3 = fun2(Table2),然后 Table4 = join(Table2, Table3) 等等。Fun 是选择或聚合。
- Tableau 仪表板将我编写的数据可视化。
如您所见,第 3 步使我的管道不是实时的。 为了使我的管道完全实时,您有什么建议? 编辑:我想要 Table1,... TableN 实时更新!
【问题讨论】:
标签: hive apache-kafka hdfs dashboard spark-structured-streaming