【发布时间】:2018-05-22 03:08:02
【问题描述】:
我正在设计一个基于 Kafka 的事件源架构,并使用 Flink 进行流处理。
一个用例是查询(过滤和排序结果)随着时间的推移通过 Kafka 主题的历史交易数据。例如“给我过去 5 年所有具有这些属性的交易,按 xx 排序”。总交易历史将在 1000 万左右,以每年 100 万的速度增长。
Flink 本身是否是此类历史查询的正确工具,并且能够以合理的性能(几秒钟)做到这一点?还是我最好将来自 Kafka 的事件输入到 MongoDB/RDBMS 等可索引/可查询的数据存储中,并将其用于历史查询?
做前者感觉它会更紧密地遵循 Kappa 架构,而使用历史数据库感觉就像我正在从那个回到 Lambda 架构。
【问题讨论】:
-
如果我是你,我会用这两者做一个 MVP,看看性能上的差异。
标签: apache-kafka apache-flink event-sourcing