【问题标题】:PromQL: identify the metrics that keep rising in time rangePromQL:识别在时间范围内不断上升的指标
【发布时间】:2020-06-24 02:58:08
【问题描述】:

即将监控 Kafka 延迟,因为有时会引发消费者卡住而没有错误。

这里的想法是......应该发送警告,如果某个“消费者组,主题”的滞后持续上升 20m(20 个样本),这意味着相邻样本在此期间要么上升要么均匀上升。

有没有办法在 promql 中定义这个触发器?

元素示例:

kafka_consumergroup_lag{consumergroup="order-beta",endpoint="http",instance="172.20.58.226:9308",job="kafka-exporter",namespace="monitoring",partition="0",pod="kafka-exporter-885fbcb9f-g9ktq",service="kafka-exporter",topic="health.check"}

【问题讨论】:

    标签: prometheus prometheus-alertmanager promql


    【解决方案1】:

    尝试使用offset modifier。例如,当kafka_consumergroup_lag 的当前值超过 20 分钟前的值时,以下 PromQL 查询将返回非空结果:

    kafka_consumergroup_lag > kafka_consumergroup_lag offset 20m
    

    尝试在 Prometheus 警报中使用此查询。

    【讨论】:

      猜你喜欢
      • 2021-04-06
      • 2020-05-01
      • 2019-05-27
      • 1970-01-01
      • 2021-10-13
      • 1970-01-01
      • 2019-09-19
      • 2023-03-31
      • 2021-01-27
      相关资源
      最近更新 更多