【发布时间】:2018-09-22 10:43:03
【问题描述】:
Spark 有一个有用的 API,用于以线程安全的方式累积数据 https://spark.apache.org/docs/2.3.0/api/scala/index.html#org.apache.spark.util.AccumulatorV2,并带有一些开箱即用的有用累加器,例如多头https://spark.apache.org/docs/2.3.0/api/scala/index.html#org.apache.spark.util.LongAccumulator
我通常使用累加器将调试、分析、监视和诊断连接到 Spark 作业中。我通常在运行 Spark 作业之前启动 Future 以定期打印统计信息(例如 TPS、直方图、计数、计时等)
到目前为止,我找不到任何与 Kafka Streams 类似的东西。有什么存在吗?我想这至少对于 Kafka 应用程序的每个实例都是可能的,但是要跨多个实例进行这项工作需要创建一个中间主题。
【问题讨论】:
-
推荐/查找工具或库的请求不在此处。
-
Kafka Streams 有聚合器和缩减器
标签: java scala apache-spark apache-kafka apache-kafka-streams