Conceito e mecanismo
Um SLI descreve uma medição e um SLO define o objetivo dessa medição numa janela e população. Escolhe indicadores que representem o serviço usado pelo negócio: aceitar e concluir uma ordem pode ser mais importante do que o processo estar ativo. Define sucesso, falha, exclusões justificadas e origem dos dados antes de analisar resultados. Num milhão de pedidos elegíveis, um objetivo de 99,9% permite mil falhas. Depois de oitocentas, restam duzentas nesse total final. O orçamento de erro informa prioridades e decisões de mudança; não é uma penalização contratual automática. Um SLA tem âmbito e consequências próprios. Evita alterar a população depois de um incidente apenas para melhorar o número apresentado.
Aplicação guiada
Numa investigação fictícia, CPU normal não exclui uma falha funcional. Compara taxa de conclusão, latência e erros com a release e as dependências. Métricas ajudam a ver padrões, logs reconstruem eventos e traces com contexto propagado localizam esperas entre serviços. Correlaciona pedido, versão e tempo sem expor dados sensíveis desnecessários. Uma coincidência temporal orienta a hipótese, mas precisa de evidência adicional. O alerta deve chegar a um owner com ação possível e contexto suficiente para avaliar impacto. Para evitar ruído, relaciona urgência com o serviço e a velocidade de consumo do objetivo, em vez de notificar cada oscilação. Conserva a evidência usada para confirmar ou rejeitar hipóteses.
Um pedido pode esperar numa dependência durante 900 ms com CPU quase inativa.
Armadilhas comuns
CPU como experiência; correlação como causa; retenção maior como contexto; SLO como contrato automático.
Tópicos relacionados: Requisitos, custos e escolha de plataforma · Dados, resiliência e eventos · Redes, provisionamento e capacidade
Mede o resultado e segue o pedido até localizar a espera ou falha.
Referência: Service level objectives · Current linked standard guide; edition date unconfirmed (2026-09-30 inspection)