【问题标题】:Druid - Streaming Data Ingestion - Continuous AggregationsDruid - 流式数据摄取 - 连续聚合
【发布时间】:2018-06-06 13:24:28
【问题描述】:

我正在考虑使用 Druid 进行聚合。我的用例是我想将数据流式传输到 Druid(在同一天,segmentGranularity 设置为 DAY),并且在摄取期间我想聚合数据。

我的问题是,当我们发送第一个数据流时,数据会被汇总并计算聚合并写入 Druid。现在,当我向 Druid 发送另一个数据流(与已经汇总的数据相关)时,druid 是如何处理它的。

druid 是更新聚合数据还是仅将此数据附加到现有聚合数据中?

【问题讨论】:

    标签: stream druid


    【解决方案1】:

    Druid 适用于两种类型的摄取 - 流式摄取和批处理文件摄取。对于流式摄取,它通过连接到 kafka 的 Tranquality 服务器或 Firehose 完成(推送与拉取)。 -

    对于流数据,汇总聚合被附加到 以前的数据。

    对于批量摄取 - Druid 重新摄取给定时间范围或段的整个数据。

    对于您的用例(每天),如果您没有重复数据问题(即相同的数据流可能再次出现),您可以进行流式摄取,否则最好在指定的时间间隔完成批量摄取,例如。每小时一次。

    【讨论】:

      【解决方案2】:

      感谢您的评论。我能够让德鲁伊处理流式摄取和聚合。

      我发现当数据再次流式传输时,数据聚合正在更新。

      谢谢

      【讨论】:

        猜你喜欢
        • 2022-08-09
        • 2016-08-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2019-07-01
        • 1970-01-01
        • 2020-12-31
        • 1970-01-01
        相关资源
        最近更新 更多