← Production Support L3: investigar e recuperar
05 / 12 · 20 MIN

Medir impacto e confirmar recuperação

Usa indicadores do serviço, objetivos e janelas de observação para decidir estabilidade.

Medir o que o utilizador precisa

Latência, tráfego, erros e saturação são pontos de partida úteis, mas precisam de contexto. O sucesso de negócio pode exigir que um batch termine antes do cutoff ou que um ficheiro esteja reconciliado. Define numerador, denominador, janela e exclusões de cada indicador. Diferencia SLI, a medida, de SLO, o objetivo, e SLA, o acordo com condições e consequências específicas.

Agregados podem esconder falhas

Uma média de latência pode esconder pedidos muito lentos. Um sucesso global elevado pode ocultar falha total num cliente ou rota pequena. Analisa percentis e segmentos relevantes sem criar cardinalidade descontrolada. Uma queda no número de erros pode dever-se a ausência de tráfego, não a recuperação. Compara volume e resultado em conjunto.

Recuperação e acompanhamento

Define o que demonstra retorno do serviço: operação funcional, dependências, filas em redução e reconciliação, conforme o caso. Mantém uma janela de observação proporcional ao ciclo do serviço. Um batch noturno pode exigir validação do próximo ciclo para confirmar a eficácia da correção. Regista o instante de recuperação e separa-o do fecho da investigação de causa.

Aplicação no trabalho

Depois de restaurar workers, mede entradas e conclusões na mesma janela. A capacidade de esvaziar a fila é a diferença entre as duas taxas, não o throughput bruto. Compara o tempo previsto com o prazo e inclui incerteza. Se uma rota crítica continua indisponível, uma média global favorável não justifica encerrar o impacto desse serviço.

NA PRÁTICA

Erros caíram de 500 por minuto para zero, mas o tráfego também caiu para zero porque uma rota ficou bloqueada. O painel verde é enganador. A recuperação deve demonstrar que pedidos representativos voltam a chegar e a concluir com o resultado esperado.

Armadilhas comuns

Ignorar procura e backlog; usar média que oculta falha crítica.

Tópicos relacionados: Transformar o incidente em melhoria verificável · Passagem de turno e escalamento

Leva esta ideia contigo

Ausência de alertas não basta: recuperação requer procura atendida e resultado funcional demonstrado.

Criar conta

Referência: Implementing SLOs · DR Production Support L3 2026.4; Linux, JDK 25 HotSpot, OpenSSL 3.5 and Kubernetes examples require installed-version checks