【问题标题】:How to create ImagePullBackOff alert and its recovery alert for Kubernetes on Datadog?如何在 Datadog 上为 Kubernetes 创建 ImagePullBackOff 警报及其恢复警报?
【发布时间】:2021-09-07 13:58:29
【问题描述】:

由于ImagePullBackOff 在 Kubernetes 集群上使用 Datadog,我正在尝试创建警报,如下所示(有关详细信息,请参阅 this 文档)

虽然警报已正确创建,但我遇到了恢复警报的问题。在纠正错误后它永远不会恢复,因为在纠正错误之后,吊舱被破坏并且它永远不会变为零,如下所示。有什么方法可以创建恢复警报?

【问题讨论】:

  • 您好@ord_bear,如果我的回答对您有帮助,您可以投票并接受它作为答案(点击答案旁边的复选标记,将其从灰色切换为已填充。)。这对其他社区成员可能是有益的。谢谢。

标签: kubernetes datadog


【解决方案1】:

• 我建议您使用“kubectl describe”解决此问题。这将向您显示 Pod 的完整错误日志,以便您查看导致问题的原因以及恢复警报没有发出的原因。您可以参考“kubectl describe”的事件输出。

• 此外,检查是否存在拼写错误、错误的标签名称、在创建的指标中定义的缺少注册表秘密以及部署在 datadog 中以进行监控的 pod 配置。

• 由于您已经创建了一个监控 Kubernetes pod 的指标,因此您可以测试为 pod 设置的监视器的通知,并检查其事件是否有任何错误,以便在删除 pod 时触发恢复警报。

• 此外,当监视器触发警报时,它被归类为“警报”、“警告”或“无数据”,如果它被停机,它会被禁止通知您,因此请检查停机时间是否正常。为该监视器和 pod 安排与否。并检查为监视器配置的恢复阈值,因为您已配置“不需要完整的数据评估窗口”选项。

请在以下链接中找到更多信息:-

https://docs.datadoghq.com/monitors/create/types/metric/?tab=threshold

https://docs.datadoghq.com/monitors/faq/why-did-i-get-a-recovery-event-from-a-monitor-that-was-in-a-downtime-when-it-alerted/

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2017-06-29
    • 1970-01-01
    • 1970-01-01
    • 2015-05-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多