Você não tem um problema de monitoramento. Tem um problema de ruído. Isso muda completamente o que você deve comprar, e o que deve parar de comprar.
Em mais de duas décadas operando monitoramento para empresas brasileiras, tem uma cena que se repete em quase todo cliente novo. O time abre o painel, Zabbix, OpMon, o que for, e mostra 1.400 problemas ativos. E ri. Não é riso de orgulho. É riso de quem desistiu.
"A gente já nem olha", o gestor diz. "Quando importa, a galera grita no WhatsApp."
Esse é o estado real da observabilidade na maior parte das empresas médias brasileiras. Não é falta de monitoramento. É excesso. E nenhuma ferramenta nova de IA, painel mais bonito ou "AIOps revolucionário" resolve isso sozinha, porque o problema não é tecnológico. É de volume sem hierarquia.
Quando uma empresa percebe que está afogada em alerta, a primeira reação costuma ser comprar uma ferramenta que centraliza o monitoramento. Mais um console, mais um SaaS, mais um lugar para o alerta cair. Isso resolve um problema secundário, a fragmentação de fontes, e amplia o problema principal: agora todos os alertas chegam ao mesmo lugar, mais rápido, e o time, exausto, ignora todos juntos.
Centralizar ruído não é resolver ruído. É concentrar a explosão.
A segunda reação é mais sofisticada e mais cara: contratar uma plataforma de AIOps para correlacionar incidentes. A IA olha o mar de alertas, agrupa por similaridade e devolve incidentes agregados. Funciona melhor que nada, mas tem dois problemas grandes:
A ordem está errada. Você não deve analisar primeiro e filtrar depois. Deve filtrar primeiro e analisar depois.
Filtro determinístico de eventos é a coisa mais subestimada de observabilidade. É código antigo, sem hype, sem demo bonita. E é o que faz a diferença entre 1.400 alertas por dia e 40.
No KeepGreen esse filtro tem seis camadas, todas determinísticas, nenhuma IA, todas configuráveis por cliente. Elas rodam nesta ordem:
| Camada | O que descarta | Volume típico |
|---|---|---|
| Deduplicação | Mesmo evento, mesmo host, em janela curta | 30–50% |
| Hysteresis | Flapping, sobe-desce, sobe-desce | 10–20% |
| Throttle | Rajada absurda, 200 alertas em 1s | 5–10% |
| Supressão topológica | Sintoma de uma causa já capturada | 10–25% |
| Inibição por severidade | Warning enquanto há disaster no mesmo recurso | 5–10% |
| Detecção de crônico | O alerta que dispara há meses | marca, não descarta |
Somando, o efeito é de 60% a 80% menos eventos chegando na camada de IA e, portanto, na sua caixa de notificação. Em alguns clientes vimos picos de 91%.
Nada é deletado. Cada evento descartado tem trilha de auditoria: qual camada cortou, com que regra, em que janela. Você audita o filtro mês a mês e calibra.
Quando você roda IA em cima de um stream já filtrado, três coisas mudam:
Existe um meme técnico que diz "garbage in, garbage out". Vale aqui em dobro. A IA do seu AIOps é tão boa quanto a comida que você dá para ela.
Sobre o stream já limpo, o KeepGreen entrega bastante coisa: causa raiz por IA, post-mortem automático no recovery, ligação telefônica em português às 3h da manhã, escalação no WhatsApp e abertura automática de chamado no service desk. Mais recentemente, passou a classificar a frota por dimensionamento, com recomendação de upgrade ou downsize no módulo de FinOps.
Tudo isso pesa. Mas o que os clientes mencionam primeiro, mês após mês, não é nenhum desses recursos. É o número de eventos que o filtro corta. Ver que, dos 1.400 alertas do mês passado, só 187 chegaram, e que desses 187 apenas 12 exigiram ação humana, é o que muda a relação do time com o painel.
"Menos alarme" é uma promessa que o cliente sabe medir. Por isso é a primeira coisa que ele nota, e a mais difícil de abrir mão depois.
Alguns sintomas. Se você marcar três ou mais, é hora de tratar ruído antes de qualquer outra coisa:
Se nada disso descreve sua operação, parabéns. Se alguns descrevem, ainda dá para resolver com calibração e supressão. Se todos descrevem, você não precisa de mais ferramenta. Precisa de uma central de alertas e insights. Pessoa ou produto, mas alguém que faça a triagem.
Trate ruído antes de tratar inteligência. Você vai resolver mais problemas, gastar menos dinheiro e, surpresa, fazer sua IA funcionar melhor. É a coisa mais chata do mundo de implementar. Por isso quase ninguém implementa direito, e por isso é o trabalho mais valioso, e mais invisível, que o KeepGreen faz.
Levamos 30 minutos. Olhamos seu painel, mostramos o que o filtro cortaria, você decide se faz sentido seguir.