← Production Support L3: investigar e recuperar
11 / 12 · 50 MIN

Observabilidade e evidência distribuída

Interpreta traces, métricas e problemas sem confundir lacunas de observação com resultados do negócio.

Ligar evidência entre serviços

Um pedido de valorização pode atravessar API, worker e serviço de dados. Para investigar uma falha, começa pelo identificador operacional, pelo intervalo e pelos componentes conhecidos. O contexto de tracing ajuda a ligar spans entre processos quando é propagado corretamente. Num exercício, os logs comprovam execução no worker, mas o trace termina na API: verifica a fronteira HTTP e a instrumentação antes de concluir que o worker não recebeu trabalho. Conserva a distinção entre o ID da operação de negócio e o trace ID. A relação entre ambos deve ser observável sem expor conteúdo financeiro desnecessário.

Amostragem e ausência de traces

A pesquisa de traces não deve ser tratada como um ledger. A amostragem conserva parte das observações, e uma política que favorece erros altera a proporção de falhas visível. Num caso fictício, 40% dos traces guardados têm erro porque a política os privilegia; esse valor não é automaticamente a taxa global do serviço. Para uma instrução reclamada, consulta o estado operacional e a cobertura da telemetria. Regista também a janela, filtros e atrasos de ingestão. A conclusão útil pode ser “execução confirmada, trace indisponível”, deixando a lacuna de observabilidade como ação separada.

Contadores, resets e dados ausentes

Antes de interpretar um gráfico, identifica o tipo de métrica e o intervalo da consulta. Um contador pode reiniciar quando o processo reinicia; a queda não representa pedidos negativos. Em Prometheus, calcula rate por série antes de somar instâncias para preservar tratamento de resets. Num exercício, um processo reinicia enquanto outro recebe mais tráfego: a soma bruta pode esconder o reset. Se o scraping falhou, “sem dados” também não equivale a zero. Cruza a observação com contagens de entrada ou fila e indica a idade da última amostra válida na atualização operacional.

Percentis e populações comparáveis

Um p95 descreve uma distribuição de observações. Somar ou calcular a média dos p95 de dois servidores não recupera o percentil dos pedidos combinados, mesmo com ponderação por volume. Usa distribuições agregáveis, como histogramas compatíveis, quando precisas do resultado global. No caso de dois clusters, conserva ainda a análise do fluxo crítico se este só passa num deles. Uma estatística global correta também pode esconder um segmento importante. Explica ao gestor quais populações foram observadas, a janela e os critérios acordados; não preenchas uma lacuna de dados com uma precisão inventada.

Labels que ajudam a decidir

Escolhe dimensões de métricas que respondam a perguntas operacionais com um conjunto limitado de valores. Ambiente, serviço e template de rota permitem comparar segmentos. Um URL completo com IDs ou uma label por trace pode criar uma quantidade crescente de séries. Num exercício de desenho, precisas de localizar falhas por endpoint: usa /orders/{id} como rota normalizada e mantém o identificador individual na evidência apropriada, com controlo de acesso. Evita recolher tokens ou números de conta por conveniência. Revê o custo, a utilidade e a necessidade de cada dimensão antes de aumentar a instrumentação.

Problemas Dynatrace e aceitação funcional

No Dynatrace, um problema relaciona eventos e contexto de dependências para orientar a investigação. Inspeciona entidades afetadas, evidências e impacto, em vez de usar apenas o primeiro alerta recebido. Num incidente fictício, o problema de latência fecha após recuperação da dependência, mas 300 instruções continuam por reconciliar. A atualização deve indicar recuperação técnica e trabalho de negócio pendente, com responsável e próxima hora de comunicação. O ciclo de vida da ferramenta não substitui o critério de aceitação do serviço. Resume sempre o que a telemetria sustenta e o que exige outra evidência.

NA PRÁTICA

Uma instrução está confirmada no ledger, mas não aparece no tracing amostrado. Reconcilia o identificador operacional antes de autorizar qualquer repetição.

Armadilhas comuns

Amostra como universo completo; média de percentis; falta de dados como zero; fecho de alerta como aceitação.

Tópicos relacionados: Passagem de turno e escalamento · Runbooks que permitem decidir · Diagnóstico Linux, JVM e conectividade

Leva esta ideia contigo

Cada conclusão deve indicar população, janela, cobertura e evidência independente do resultado.

Criar conta

Referência: Context propagation · DR Production Support L3 2026.4; Linux, JDK 25 HotSpot, OpenSSL 3.5 and Kubernetes examples require installed-version checks