Conceito e mecanismo
Um SLI mede uma característica definida do serviço; o SLO estabelece o objetivo e a janela. Especifica eventos elegíveis, critério de sucesso e origem da medição. Um indicador de HTTP 200 pode ser útil para transporte, mas não cobre automaticamente data, completude ou correção do conteúdo. Combina sinais externos do percurso com telemetria interna para localizar a falha. Média de latência pode ocultar uma cauda lenta; percentis descrevem a distribuição, não uma percentagem fixa de erros. Segmenta operação, versão e período quando essa separação ajuda a explicar o impacto. Uma medição sem amostras deve mostrar a limitação de cobertura, não transformar automaticamente ausência em zero falhas.
Aplicação guiada
No exercício, 19 900 pedidos bons entre 20 000 elegíveis produzem 99,5%. Para um objetivo de 99,9%, o orçamento corresponde a vinte eventos maus; os cem observados excedem-no. Esta conta usa eventos de um período fechado e não deve ser convertida diretamente em minutos de indisponibilidade. Noutro caso, respostas rápidas devolvem posições de ontem: acrescenta uma verificação funcional da data e investiga a cadeia de dados. Um alerta deve apontar para uma ação proporcional ao risco e ao tempo disponível, sem obrigar a equipa a acompanhar permanentemente o painel. Se a recolha falhar durante manutenção, comunica o intervalo desconhecido e procura evidência alternativa antes de concluir que o serviço melhorou ou parou.
HTTP 200 com dados antigos exige validar o conteúdo; zero amostras exige validar a medição.
Armadilhas comuns
Excluir pedidos maus do denominador; misturar tempo e eventos; usar só média; interpretar ausência como sucesso.
Tópicos relacionados: O serviço, o impacto e a responsabilidade · Incidentes, comunicação e mudança de turno · Batch, ficheiros e reconciliação
Explica sempre o que o indicador cobre e o que deixa por observar.
Referência: Implementing SLOs · DR APS professional curriculum 2026-09; vendor-neutral operational guidance reviewed 2026-09-30