Compreender o conceito
Uma média de latência pode manter-se baixa enquanto uma minoria de pedidos demora muito. Um percentil descreve a distribuição numa população e janela definidas; não identifies o p95 global calculando simplesmente a média dos p95 de cada instância. Compara medições equivalentes e observa volume e erros em conjunto. Um servidor com CPU baixa pode estar bloqueado à espera de I/O ou de uma dependência. Métricas orientam a investigação; não identificam sempre uma causa sozinhas.
Aplicar e decidir
Num caso fictício, /consulta representa 99% do tráfego e /fecho apenas 1%. Se /fecho falhar totalmente, o sucesso global ainda é 99%, apesar de o processo de fecho estar indisponível. Separa as operações críticas e interpreta os indicadores segundo o impacto. Usa identificadores de correlação em logs ou traces com acesso adequado. Não uses identificadores únicos de cada pedido como etiquetas de todas as séries métricas: multiplicam as combinações e o custo.
Aplicação no trabalho
Para investigar degradação, mantém população e janela comparáveis. Uma rota crítica pode falhar totalmente e continuar quase invisível no agregado. Não reconstruas p95 global a partir da média, mesmo ponderada, de percentis individuais. Usa histogramas compatíveis ou observações adequadas. Guarda identificadores únicos em logs ou traces controlados; labels de métricas devem ter cardinalidade planeada.
O painel do balanceador mostra 99% de sucesso. O suporte confirma que todos os fechos de lote falham. Filtra a rota e a população afetada, segue um pedido de exemplo e compara o comportamento antes e depois da alteração.
Armadilhas comuns
Agregar percentis por média; criar uma série métrica por pedido.
Tópicos relacionados: Mapear o percurso do pedido · Investigar JVM, heap e pausas
Um agregado saudável pode esconder uma operação crítica indisponível.
Referência: Histograms and summaries · DR Middleware 2026.4; HotSpot JDK 25; JDBC 25; PostgreSQL 18; RabbitMQ 4.3; OpenSSL 3.5; explicitly scoped runtime references