Conceito e mecanismo
Métricas, logs e traces respondem a perguntas diferentes e complementares. Uma métrica resume comportamento ao longo do tempo; um log descreve um evento; um trace liga operações de um pedido quando existe instrumentação e contexto propagado. Para uma valorização lenta que passa por API, fila e cálculo, CPU média global não mostra necessariamente onde o tempo foi gasto. Define a pergunta de diagnóstico antes de escolher o gráfico. Considera também o que não foi recolhido: ausência de trace não prova que o pedido nunca ocorreu. O desenho de observabilidade deve permitir relacionar aplicação e dependências sem depender de acesso indiscriminado a dados sensíveis.
Aplicação guiada
Um objetivo de serviço precisa de indicador, população e janela. Num exemplo baseado em pedidos, 99,9% de sucesso em um milhão de pedidos elegíveis permite 1000 falhas; com 900 já contabilizadas, restam 100 nesse mesmo universo fixo. Não convertas esse resultado em minutos sem definir um indicador temporal. A escolha de ferramentas também exige contexto. A maturidade CNCF informa sobre o projeto e a sua sustentabilidade, mas não fornece automaticamente um SLA para a tua instalação. Avalia requisitos, licenças, atualizações, competências e responsabilidade operacional. Numa equipa internacional, documenta decisões e critérios de aceitação para que desenvolvimento, plataforma e APS consigam trabalhar com a mesma evidência.
No comité de passagem a produção, apresenta a transação observada, o objetivo, quem recebe alertas e quem decide sobre consumo do orçamento de erro.
Armadilhas comuns
CPU como latência de qualquer pedido; falta de trace como ausência de evento; percentagem sem denominador; graduated como SLA.
Tópicos relacionados: Estado desejado, controlo e containers · Capacidade, scheduling e tipos de workload
Os sinais e as ferramentas só ajudam quando estão ligados a um objetivo e a responsáveis concretos.
Referência: Telemetry signals · KCNA current four-domain curriculum; edition date unconfirmed