【发布时间】:2018-08-22 08:16:27
【问题描述】:
背景
后端日志处理系统已经在 Kafka 和 Storm 集群中到位。
用例
在后端生成并记录多个特定类型的事件X。每个都包含一个 ID,比如 userid。现在这些事件被一个风暴螺栓消耗并提取 useid 和其他一些字段说 userdata 并写入 kafka 中的另一个主题,比如 data 主题。
现在一些其他拓扑从这个data 主题消费。它使用单个userid 和不同的userdata 查找多个此类事件。如果有n 这样的记录向他们展示,则需要采取一些措施。
问题
如何使用来自 kafka 的一些关键数据在风暴螺栓中聚合?
有些用户可能会在 20 分钟内达到N 记录计数,有些可能需要几个小时,具体取决于用户交互,因此事件记录在后端。目标是当此类记录的计数达到某些 N 时,获取所有用户 ID 和相应的 usedata
【问题讨论】:
标签: apache-kafka apache-storm aggregation