Medir o que o utilizador precisa
Latência, tráfego, erros e saturação são pontos de partida úteis, mas precisam de contexto. O sucesso de negócio pode exigir que um batch termine antes do cutoff ou que um ficheiro esteja reconciliado. Define numerador, denominador, janela e exclusões de cada indicador. Diferencia SLI, a medida, de SLO, o objetivo, e SLA, o acordo com condições e consequências específicas.
Agregados podem esconder falhas
Uma média de latência pode esconder pedidos muito lentos. Um sucesso global elevado pode ocultar falha total num cliente ou rota pequena. Analisa percentis e segmentos relevantes sem criar cardinalidade descontrolada. Uma queda no número de erros pode dever-se a ausência de tráfego, não a recuperação. Compara volume e resultado em conjunto.
Recuperação e acompanhamento
Define o que demonstra retorno do serviço: operação funcional, dependências, filas em redução e reconciliação, conforme o caso. Mantém uma janela de observação proporcional ao ciclo do serviço. Um batch noturno pode exigir validação do próximo ciclo para confirmar a eficácia da correção. Regista o instante de recuperação e separa-o do fecho da investigação de causa.
Aplicação no trabalho
Depois de restaurar workers, mede entradas e conclusões na mesma janela. A capacidade de esvaziar a fila é a diferença entre as duas taxas, não o throughput bruto. Compara o tempo previsto com o prazo e inclui incerteza. Se uma rota crítica continua indisponível, uma média global favorável não justifica encerrar o impacto desse serviço.
Erros caíram de 500 por minuto para zero, mas o tráfego também caiu para zero porque uma rota ficou bloqueada. O painel verde é enganador. A recuperação deve demonstrar que pedidos representativos voltam a chegar e a concluir com o resultado esperado.
Armadilhas comuns
Ignorar procura e backlog; usar média que oculta falha crítica.
Tópicos relacionados: Transformar o incidente em melhoria verificável · Passagem de turno e escalamento
Ausência de alertas não basta: recuperação requer procura atendida e resultado funcional demonstrado.
Referência: Implementing SLOs · DR Production Support L3 2026.4; Linux, JDK 25 HotSpot, OpenSSL 3.5 and Kubernetes examples require installed-version checks