Documentação

KeepGreen · documentação

Documentação completa do KeepGreen: arquitetura, conectores, filtros, IA, canais, escalação, segurança, LGPD, SLA, integrações.

Visão geral

O KeepGreen é uma camada de inteligência que opera entre o seu monitoramento (OpMon, Zabbix) e a sua equipe. Em vez de centenas de alertas crus, entrega incidentes contextualizados: com causa raiz provável, solução sugerida e roteamento por canal correto.

O que faz

  • Filtra eventos por seis camadas determinísticas antes de qualquer análise.
  • Correlaciona com topologia descoberta e histórico de 72h (configurável).
  • Aplica IA supervisionada para gerar título, causa raiz, solução e perfil indicado.
  • Roteia por canal apropriado (WhatsApp, Slack, Teams, ligação IA, e-mail, SMS, Service Desk, webhook).
  • Escala por tabela de plantão, com timeout configurável.
  • Gera post-mortem automático no recovery.

O que não faz

  • Não executa comandos no seu ambiente. Não há auto-remediação. Quem age é seu time.
  • Não substitui seu monitoramento. Plug-in, não replacement.
  • Não tem checkout self-service. Onboarding é consultivo.
Posicionamento. O KeepGreen é uma Central de Eventos. Detecta, higieniza, prioriza, avisa com contexto, escala. Ele substitui o trabalho que um humano de plantão faria. Não o trabalho de quem resolve.

Arquitetura

O fluxo de dados percorre cinco etapas. Tudo entre a fonte (monitoramento) e o destino (você) é leitura → análise → notificação. Nenhum caminho de volta toca seu ambiente.

// fluxo de dados
[ Seu ambiente ]                      // vocêread-only
[ OpMon / Zabbix ]                    // já existe
       ↓ TLS · túnel dedicado
[ Coletor KeepGreen ]               // borda
       ↓
[ Filtro (6 camadas) ] → descarta 60–80%
       ↓
[ Analyzer (IA + topologia + histórico) ]
       ↓
[ Roteador (regras de canal) ]
       ↓ WhatsApp · Slack · Teams · Ligação IA · E-mail · SMS · Service Desk · Webhook
[ Plantonista / supervisão KeepGreen ]

Componentes

ComponenteFunçãoEstado
ColetorIngere eventos via webhook ou polling do monitoramentoprodução
FiltroAplica 6 camadas determinísticas em sérieprodução
AnalyzerCorrelaciona, classifica, escreve análiseprodução
RoteadorDecide canal e destinatário por regraprodução
Notificador WhatsAppEnvio via WABA + escalação por tique azulprodução
Notificador Ligação IATTS PT-BR · chamada outboundprodução
Service Desk BridgeAbre/atualiza chamado em GLPI, Jira SM, ServiceNow, Freshserviceprodução

Glossário

EventoSinal bruto do monitoramento. Pode ser duplicado, redundante, sintoma.
IncidenteEvento(s) consolidado(s) após o filtro. Unidade de notificação.
CrônicoIncidente que dispara recorrentemente sem ser resolvido na causa.
Causa × SintomaDistinção feita por supressão topológica: você recebe o incidente da causa, não dos sintomas.
Causa raiz provávelHipótese da IA com base em topologia e histórico. Não é verdade absoluta.
MTTAMean Time To Acknowledge. Tempo entre detecção e reconhecimento.
MTTRMean Time To Resolution. Tempo entre detecção e recovery.
Tique azulWhatsApp: indicação de visualização. Usado como prova de ack em escalação.

Conectores

O KeepGreen recebe eventos de fontes de monitoramento existentes. Você não precisa trocar nada.

FonteModoEstado
OpMonWebhook + polling de complementoprodução
ZabbixWebhook (media type customizado)produção
Prometheus / AlertmanagerWebhook receiverprodução
Datadog MonitorsWebhook outboundprodução
GenéricoHTTP webhook + schema JSONprodução

Payload mínimo (genérico)

{
  "host": "keepgreen-hub",
  "service": "process_mysql",
  "severity": "disaster",
  "state": "PROBLEM",
  "message": "MySQL service is down",
  "timestamp": "2026-05-17T02:47:18-03:00",
  "tags": { "env": "prod", "team": "dba" }
}

Filtragem em 6 camadas

O filtro roda antes da análise IA. Determinístico, auditável, configurável por cliente. Tudo passa por ele.

Ordem das camadas

  1. Deduplicação: mesmo host + service + state em janela curta vira 1.
  2. Hysteresis: flapping (sobe-desce repetido) é suprimido até estabilizar.
  3. Throttle: rajadas absurdas (ex.: 200 eventos em 1 segundo) são limitadas.
  4. Supressão topológica: se a causa-raiz já foi capturada, sintomas filhos somem.
  5. Inibição por severidade: warning de um recurso some quando há disaster ativo nele.
  6. Detecção de crônico: recorrência marca, não descarta.

Parâmetros globais

ParâmetroDefaultO que controla
janela_correlacao15 minJanela para considerar eventos relacionados.
lookback_historico72 hQuanto tempo olhar para trás para detectar recorrência.
dedup_window60 sJanela de deduplicação.
chronic_threshold5 / 7dQty de ocorrências em 7 dias para marcar como crônico.
throttle_rate50 ev/sLimite de ingestão por host.
Auditoria. Cada evento descartado é arquivado com a regra que o cortou. Você pode auditar o que não chegou. Útil para calibrar e provar que nada importante foi engolido.

Análise por IA

Sobre o stream filtrado, o Analyzer correlaciona o evento atual com:

  • Topologia descoberta (relações pai/filho de hosts e serviços).
  • Histórico de ocorrências da mesma assinatura.
  • Runbooks e base de conhecimento configurada pelo cliente.

Em cima disso, gera um incidente contextualizado contendo:

CampoConteúdo
titleFrase curta em PT-BR descrevendo o problema
analysisParágrafo explicando o que foi observado
root_causeHipótese da causa raiz
suggested_actionO que tentar primeiro
profilePerfil profissional indicado (DBA, SRE, Redes…)
affected_resourcesLista de hosts/serviços impactados
confidenceGrau de confiança da IA (low / med / high)

Supervisão humana

A IA opera sob calibração contínua do plantão de operações da KeepGreen. Hipóteses de baixa confiança são marcadas e revisadas em ciclo curto. Não é IA solta.

Canais & roteamento

Cada incidente é roteado por regras que cruzam severidade, horário, grupo e plano contratado. O mesmo incidente pode tomar caminhos diferentes em horários diferentes.

CanalQuando entraEstado
E-mailLog completo · todos os incidentesprodução
SlackCanal por grupo · severidade alta+produção
Microsoft TeamsIdem Slackprodução
WhatsAppDisaster · plantonista de turnoprodução
Ligação com voz IADisaster · fora do horário comercialprodução
SMSFallback se WhatsApp falharprodução
Telegram / StatuspageOpcionalprodução
Service DeskAbre chamado automaticamenteprodução
WebhookQualquer destino HTTP que você definirprodução

Exemplo de regra de roteamento

{
  "name": "db-prod-crítico-noite",
  "match": {
    "severity": "disaster",
    "tags.team": "dba",
    "time": "22:00-08:00 BRT"
  },
  "channels": [
    "whatsapp:plantao-dba",
    "call:plantao-dba",
    "service_desk:db-prod"
  ],
  "escalation": "after_5min_no_ack"
}

Escalação

Escalação automática é por ausência de reconhecimento. O KeepGreen respeita sua tabela de plantão. Quem está OOO é pulado.

Critérios de ack por canal

  • WhatsApp: tique azul + clique no botão "Reconhecer".
  • Slack / Teams: clique no botão "Reconhecer" ou comando /ack.
  • Ligação IA: confirmação por DTMF ("digite 1 para reconhecer") ou voz.
  • E-mail / SMS: link de ack autenticado.

Timeouts default

SeveridadeNível 1 → 2Nível 2 → 3
Disaster5 min10 min
High15 min30 min
Average1 hn/a

Post-mortem automático

Quando o recovery é detectado (estado volta para OK e estabiliza), o KeepGreen gera um post-mortem com:

  • Timeline completa de eventos correlacionados
  • Causa raiz confirmada (atualizada se a hipótese inicial foi revisada)
  • Ação que resolveu (inferida da conversa de ack ou de update humano)
  • MTTA e MTTR finais
  • Recursos afetados (raio do impacto)

O post-mortem é indexado e usado pela IA como contexto na próxima ocorrência similar.

Mapa topológico

Descoberta automática a partir das relações declaradas no OpMon (parents/children) e enriquecimento por inferência (ex.: hosts que compartilham dependência de rede).

  • Forma: diamante = raiz, hexágono = intermediário, quadrado = folha.
  • Cor: verde (UP), vermelho (DOWN), amarelo (warning), cinza (sem dado recente).
  • Tamanho: proporcional ao blast radius (quantos filhos dependem dele).

Hosts com incidente recente mas sem topologia mapeada aparecem como "órfãos" no canto inferior. Sinal de que aquele host precisa de parents configurado.

Integração com Service Desk

O KeepGreen abre, atualiza e fecha tickets automaticamente no service desk corporativo. Suportes nativos planejados:

FerramentaModoEstado
GLPIAPI REST + plugin oficialprodução
Jira Service ManagementAPI RESTprodução
ServiceNowAPI RESTprodução
FreshserviceAPI RESTprodução
GenéricoWebhook bidirecionalprodução

Campos sincronizados

Ticket recebe: título, severidade, host afetado, análise da IA, causa raiz provável, solução sugerida, link de volta para o incidente. Update do ticket reflete no incidente (status, atribuição, comentários).

Webhooks

O KeepGreen aceita webhooks de entrada (eventos) e dispara webhooks de saída (incidentes, transições de estado, recovery, post-mortem).

Webhook de saída · payload de incidente

POST https://seu-destino.example.com/keepgreen-events
Content-Type: application/json
X-KeepGreen-Signature: hmac-sha256(...)

{
  "event": "incident.created",
  "id": "inc_8f3a",
  "severity": "disaster",
  "title": "MySQL inoperante por esgotamento de swap",
  "host": "keepgreen-hub",
  "service": "process_mysql",
  "root_cause": "Memória swap esgotada",
  "suggested_action": "Reiniciar serviço, investigar leak",
  "affected": ["app-api-01", "app-api-02"],
  "link": "https://keepgreen.ai/i/inc_8f3a"
}

API REST

Endpoints para integração programática. Autenticação por token de longa duração (rotacionável).

EndpointMétodoO que faz
/v1/eventsPOSTIngere evento genérico
/v1/incidentsGETLista incidentes (filtros por host, severidade, janela)
/v1/incidents/:idGETDetalhe completo (timeline, análise, post-mortem)
/v1/incidents/:id/ackPOSTReconhece (com motivo opcional)
/v1/incidents/:id/notePOSTAdiciona nota humana
/v1/metricsGETMTTA, MTTR, volume, crônicos por período

SLA contratual

O KeepGreen tem um SLA contratual: tempo de primeira resposta após detecção de incidente disaster.

PlanoCoberturaSLA de 1ª respostaCompensação
Basic8×5 (horário comercial)10 min5% mensal a cada hora de atraso
Professional24×510 min5% mensal a cada hora de atraso
Enterprise24×75 min10% mensal a cada 10 min de atraso, até 100%
O que o SLA cobre. O tempo entre detecção do incidente pelo KeepGreen e primeira notificação acionável ao cliente. Não cobre tempo até resolução, que depende do seu time.

Segurança

Princípios

  • Somente leitura. Não executamos comandos no seu ambiente.
  • Túnel dedicado. Conexão criptografada (TLS 1.3) entre seu monitoramento e nosso coletor.
  • Isolamento por cliente. Sem cross-tenant. Dado de cliente A não passa por contexto de cliente B.
  • Sem credencial de produção. A única credencial que pedimos é de leitura do monitoramento.

Auditoria

Log de acesso completo. Cada query ao seu monitoramento é registrada com timestamp, origem (analyzer, filtro, supervisão humana) e propósito. Exportável.

Supervisão humana

O time de operações da KeepGreen tem acesso a dashboards agregados. Acesso a dado individual de incidente é registrado e auditável pelo cliente.

Privacidade & LGPD

O KeepGreen processa dados de telemetria operacional. Não processa dados pessoais de usuários finais do cliente, exceto se incluídos em payload de monitoramento, situação em que tratamos como dado sensível.

Bases legais

  • Execução de contrato (art. 7º V) para dados de monitoramento operacional.
  • Legítimo interesse (art. 7º IX) para logs de auditoria interna.

Retenção

Tipo de dadoRetenção padrão
Eventos brutos descartados30 dias
Incidentes13 meses
Post-mortemsindefinido (conhecimento)
Logs de acesso13 meses
Notificações enviadas (WhatsApp, e-mail)90 dias

Direitos do titular

Solicitações de acesso, correção ou eliminação de dados pessoais podem ser feitas pelo encarregado do cliente (controlador) através do canal de contato. A KeepGreen atua como operadora dos dados.

KeepGreen © 2026 KeepGreen · Porto Alegre · Brasil · uma operação OpServices