【发布时间】:2014-09-22 17:09:03
【问题描述】:
我有一个服务器集群。我手动编码的常见任务是:
- 使用metrics 库收集各种统计数据(失败、成功、次数)。
- 聚合那些组合跨集群。
- 根据条件检查聚合统计信息跨集群并根据该发送警报。 (而不是让每台服务器发送警报,而是将轮询的全局指标增加到 graphite)。
- 如果一个特定节点发送一个警报,它首先累积并基于来自其他节点的警报(再次跨集群场景),那么我将决定发送哪个警报(所以如果我有 100 台服务器,不是每个服务器都发送单独的警报,而是一个)。
我研究了一些框架,但没有一个可以实现这一点:metrics、javamelody、netflix servo、netflix zuul
但它们都不支持例如我的跨集群场景,我想随着时间的推移汇总统计信息,并且只有在某些条件适用时才发送警报(作为避免跨服务器重复警报的一种方法)。我需要为此建立自己的框架吗?还是已经存在一些东西?
(如果我的用例听起来很具体,所以我应该编写它,我有更多类似的用例,这让我想为什么没有这样的框架,在我开始编写我没有的东西之前想找到我只是复制了一些其他框架)。
【问题讨论】:
标签: java monitoring snmp metrics