Perguntar “qual é um bom MTTR” quase sempre rende uma resposta vaga. O mercado repete números de 2014 como se fossem de hoje. Além disso, mistura tempo de atendimento de service desk com recuperação de produção e raramente cita a pesquisa de origem. Esta página existe para resolver isso. Reunimos aqui as estatísticas de MTTR […]
Remediação automática de incidentes: o que é e como aplicar
Toda equipe de operações conhece a cena. Um alerta dispara às 3h da manhã, alguém acorda, abre o runbook e reinicia um serviço que já travou dezenas de vezes. A remediação automática de incidentes existe justamente para eliminar esse desperdício recorrente. Em vez de depender de uma pessoa para repetir a mesma correção, o sistema […]
ChatOps: o que é, como funciona e benefícios para TI
Para times de TI que vivem entre painéis, terminais e canais de chat, o context switching constante virou uma das maiores causas de fadiga operacional. ChatOps surgiu para resolver esse problema ao trazer a operação inteira para dentro da plataforma de chat que a equipe já usa o dia todo. A prática nasceu no GitHub […]
Ciclo de vida do incidente de TI: as 5 etapas, da detecção ao aprendizado
Pense no último incidente do seu ambiente e responda quem descobriu primeiro. O monitoramento, o time de plantão, um usuário que ligou para o service desk ou o diretor que abriu o painel de vendas? A resposta diz mais sobre a maturidade da operação do que qualquer fluxograma, porque expõe qual etapa do ciclo está […]
Monitoramento de causa raiz: o que instrumentar para a causa chegar junto com o alerta
Às 3h12 o console abre com 180 alertas. Banco de dados fora, aplicação retornando erro 500, três balanceadores em warning, serviço de pagamento sem resposta. Todos são verdadeiros. Nenhum deles diz qual veio primeiro. Essa distância entre volume de sinal e valor de sinal é o problema real do plantão. A equipe queima os primeiros […]
Troubleshooting de aplicações: metodologia e ferramentas
Aplicações modernas rodam em microserviços, containers efêmeros, filas distribuídas e múltiplas camadas de infraestrutura na nuvem. Quando algo trava, o sintoma raramente mora onde parece morar. A pergunta “por que isso falhou?” virou uma disciplina de engenharia, não um exercício de intuição. É por isso que o troubleshooting de aplicações deixou de ser uma arte […]
MTBF e MTTR: a matemática da disponibilidade e qual métrica atacar primeiro
Todo relatório mensal de operação traz os dois números lado a lado. O MTBF subiu de 240 para 280 horas. O MTTR caiu de 4 horas para 3 horas e meia. Em seguida, o gráfico fica verde na apresentação. Mesmo assim, a pergunta que o diretor faz na reunião seguinte continua sem resposta: onde colocar […]






