【发布时间】:2019-04-05 08:27:35
【问题描述】:
我正在尝试在我的实例关闭时进行监控并获得警报。为此,我在 stackdriver 中配置了警报策略,如下所示:
指标缺失条件
在以下情况下违反:CPU 使用率(GCE 监控)缺席超过 5 分钟
它仅在第一次工作,然后从未为任何停止的实例创建任何事件。 我在这里想念什么?
【问题讨论】:
-
您使用哪些通知渠道配置了警报策略?如果您使用电子邮件渠道,通常会从 alerts@stackdriver.com 发送电子邮件,因此请确保该地址未被您的电子邮件客户端过滤或阻止。您也可以尝试使用其他频道。
-
我已经为警报通知配置了电子邮件,但我认为问题出在监控指标本身,因为堆栈驱动程序监控 GUI 上什至没有显示任何事件。
-
您有一个有效的点,如果满足政策条件但没有在警报/事件下进行条目,那么这不太可能是渠道问题。您之前提到过它在设置后立即工作,是否有任何条目记录了该违规行为?此外,在 Stackdriver Logging 的高级过滤器中,使用以下过滤器检查是否有该 VM
resource.type="gce_instance" AND (resource.labels.instance_id="[VM instance ID]" AND resource.labels.zone="[Zone]" AND resource.labels.project_id="[Project Name]")的日志 -
要查找 VM 实例 ID,请转到 VM 实例页面,单击您正在监视的 VM -> 向下滚动并单击等效 REST,然后检查 REST 响应代码是否有类似这样的内容:@ 987654323@。如果通过这种方式找不到日志,我建议在 Google 问题跟踪器中提交 private issue。这将创建一个私人问题,只有您和 Google 员工才能使用受影响的项目编号访问该问题。因此支持团队可以进一步调查此问题。
-
谢谢@SunnyJ。 ,我会试试这个然后回来。
标签: google-cloud-stackdriver google-cloud-monitoring