【发布时间】:2020-07-04 04:29:51
【问题描述】:
我正在尝试使用 Spark(以及 Flink)制作一个简单的流媒体应用程序。输入是一个 Kafka 主题,其中包含一些产品信息,在我将此产品信息写入其他地方之前,我想获取产品的类别信息并在流式传输期间添加到我的模型中。我打算将我的产品类别映射数据存储在 PostgreSQL 表或 Couchbase 存储桶中。所以我需要为每个流数据查询其中一个。我想学的是:
-
是否适用于 Spark/Flink?
-
对于流媒体应用来说这是一个好习惯吗?如果没有,我怎样才能用大数据的方式做到这一点?我应该将我的地图数据存储在其他地方,还是以其他方式将该地图数据与流数据结合起来?
【问题讨论】:
-
为什么要将映射数据存储在 PostgreSQL 或 Couchbase 中?,您可以将相同的数据推送到 kafka 并编写一个批处理作业以将相同的 kafka 数据同步到数据库??
-
每天都会有新的条目出现在产品类别映射表中。那么,我是否应该每天将映射表的所有条目推送到 Kafka,并在 Flink 上将这个新的映射流加入产品流?如果我误解了,请纠正我。
-
Flink 我没工作过.. 但是在 spark 或 kafka 流中你可以做同样的事情......一个原因是为每个记录流查询 rdbms 数据库是昂贵的操作.. 你可能会想到替代品..
标签: apache-spark spark-streaming apache-flink flink-streaming