Um servidor novo entra no inventário e alguém vincula o template de Linux. Na manhã seguinte, o painel mostra 340 itens coletando de uma máquina que só serve arquivo. Nenhum deles, porém, virou alerta útil. Enquanto isso, o banco que sustenta o faturamento continua sem a métrica que o DBA pediu na semana passada. Essa […]
Notificações no Zabbix: do bot do Telegram ao escalonamento em 3 níveis
O Zabbix detectou a queda do link às 3h12. A trigger mudou de estado, o problema entrou na tela de Problems, o gráfico guardou a interrupção inteira. Ninguém soube de nada até as 8h, quando o primeiro usuário ligou reclamando. Coleta e notificação são dois subsistemas diferentes dentro do mesmo produto. O segundo não vem […]
Penalidades do Pix: o que o Banco Central exige e como ele calcula a multa
Quase todo acordo de nível de serviço em TI vive dentro de um contrato privado. As metas saem de uma negociação caso a caso, o próprio fornecedor apura o resultado e a multa quase nunca sai do papel. No Pix, o desenho é outro. O Banco Central publica a meta em norma, publica a metodologia […]
Monitoramento de Oracle Database: o que medir, quais views usar e a armadilha do Diagnostics Pack
Quando o Oracle começa a responder devagar, o time raramente descobre pelo banco. Descobre pelo ERP travado, pelo caixa que não fecha ou pelo lote noturno que estourou a janela. A essa altura, o DBA já está apagando incêndio sem saber em que ponto a instância parou. O custo não é abstrato. Segundo a análise […]
Healthcheck e heartbeat: como escolher o sinal de vida certo para cada componente
Um dashboard inteiramente verde não prova que o sistema funciona. Ele prova apenas que alguma verificação respondeu. Quando essa verificação pergunta a coisa errada, a equipe descobre a falha pelo telefone do cliente, nunca pelo alerta. Healthcheck e heartbeat são os dois mecanismos que sustentam essa verificação. Ambos respondem à pergunta “isso ainda está vivo?”, […]
Monitoramento de Proxmox VE: o que medir em nós, VMs e cluster
Migrar para o Proxmox VE resolve o problema de licenciamento. Não resolve o problema de visibilidade. A console web mostra gráficos por nó e por VM. Ela não avisa, no entanto, quando o quorum oscila. Também fica calada quando um OSD do Ceph entra em estado nearfull ou quando o backup falhou por três noites […]
Monitoramento de impressoras: como monitorar o parque de impressão via SNMP
Toda empresa tem impressoras. Quase nenhuma tem impressoras no monitoramento. Enquanto switches, servidores e links aparecem em dashboards com alerta configurado, o parque de impressão vive fora do radar da TI. O problema aparece sozinho, na fila travada do fechamento do mês. Essa invisibilidade custa caro. A impressora é um dispositivo de rede completo: tem […]
Monitoramento do Microsoft 365: por que o Service Health não basta e o que monitorar
O chamado chega sempre com a mesma frase: o Teams caiu. Em seguida, o analista abre o portal de administração, encontra todos os serviços marcados como saudáveis e fica sem resposta para dar. Ao mesmo tempo, a diretoria cobra uma posição e o usuário continua parado. Esse desencontro tem uma explicação simples. O painel que […]
Manutenção de sistemas de monitoramento: a regra dos 6 meses
A confiança em um sistema de monitoramento atinge o pico no mês seguinte à implementação. Os alertas parecem precisos, os dashboards refletem o ambiente real e os runbooks acompanham cada cenário previsto. Tudo funciona como o projeto inicial imaginou. Seis meses depois, a história muda. Hosts já desligados continuam nos painéis, alertas crônicos passam dias […]
Alertmanager: como funciona o gerenciamento de alertas no ecossistema Prometheus
Configurar boas regras de alerta no Prometheus é só metade do trabalho. A outra metade é garantir que cada disparo chegue à pessoa certa, no canal certo, sem inundar o time com avisos repetidos. Sem essa camada, o monitoramento vira ruído: alertas críticos se perdem no meio de dezenas de notificações irrelevantes. Uma pesquisa da […]









