← Production Support L3: investigar e recuperar
02 / 12 · 20 MIN

Investigar por hipóteses e dependências

Constrói um diagnóstico discriminante entre Linux, JVM, rede e base de dados.

Sintoma, hipótese e observação

Um sintoma é o que foi observado; uma hipótese é uma explicação possível. “Pedidos demoram 30 segundos” é um sintoma. “Esperam por uma ligação JDBC” é uma hipótese que pode ser comparada com métricas de pool e stacks. Escolhe observações que diferenciem explicações concorrentes. Se a evidência contrariar a hipótese, atualiza-a em vez de repetir a mesma ação.

Cruzar as camadas no mesmo intervalo

Liga a operação de negócio a pedidos, processos e dependências. Compara erro e latência com CPU, memória, I/O, pool, chamadas externas e atividade da base de dados no mesmo período. CPU baixa não exclui saturação noutro recurso. Um pool cheio não prova que o limite é pequeno. Um timeout pode ocorrer em etapas diferentes. Mantém o mapa de dependências e a origem de cada medida.

Recolher e escalar com um pacote útil

Ao envolver uma equipa especializada, envia início, impacto, operação afetada, alterações recentes, identificadores e observações já feitas. Distingue ausência de evidência de evidência de ausência. Em bases de dados, sessões bloqueadas e query lenta exigem análise do DBA ou autoridade competente; terminar uma sessão pode implicar rollback prolongado e efeitos no negócio. Não substituas análise por uma ação irreversível só porque está disponível.

Aplicação no trabalho

Para um export lento, compara uma execução afetada com uma referência de volume semelhante. Alinha logs de aplicação, tempos da dependência e alterações recentes. Uma hipótese útil prevê uma observação que a possa contrariar. Se os pedidos pequenos funcionam e os grandes falham, preserva essa distinção na escalada em vez de comunicar apenas que toda a aplicação está lenta.

NA PRÁTICA

WebSphere espera por ligações enquanto a base de dados mostra bloqueio numa transação antiga. O pacote de escalada inclui instante, IDs de correlação, sessões relevantes obtidas por meios autorizados e a mudança que precedeu o início. A equipa decide uma mitigação conhecendo o risco da transação.

Armadilhas comuns

Confundir sintoma com causa; recolher sem hipótese ou contexto.

Tópicos relacionados: Recuperar cadeias batch sem falsificar sucesso · Validar transferências e reconciliação

Leva esta ideia contigo

Cada passo de diagnóstico deve reduzir incerteza e preservar contexto para a próxima equipa.

Criar conta

Referência: Effective troubleshooting · DR Production Support L3 2026.4; Linux, JDK 25 HotSpot, OpenSSL 3.5 and Kubernetes examples require installed-version checks