O Zabbix detectou a queda do link às 3h12. A trigger mudou de estado, o problema entrou na tela de Problems, o gráfico guardou a interrupção inteira. Ninguém soube de nada até as 8h, quando o primeiro usuário ligou reclamando. Coleta e notificação são dois subsistemas diferentes dentro do mesmo produto. O segundo não vem […]
Alertmanager: como funciona o gerenciamento de alertas no ecossistema Prometheus
Configurar boas regras de alerta no Prometheus é só metade do trabalho. A outra metade é garantir que cada disparo chegue à pessoa certa, no canal certo, sem inundar o time com avisos repetidos. Sem essa camada, o monitoramento vira ruído: alertas críticos se perdem no meio de dezenas de notificações irrelevantes. Uma pesquisa da […]
Deduplicação e agrupamento de alertas: como reduzir o ruído sem perder incidentes
Um único switch que falha pode disparar centenas de notificações em poucos minutos. O equipamento para de responder, os serviços dependentes degradam em cascata, cada verificação repete o aviso a cada 30 segundos. O incidente é um só. O plantão, porém, recebe uma avalanche. A deduplicação e o agrupamento de alertas existem para resolver exatamente […]


