← Gestão de Problemas: investigar e prevenir
10 / 12 · 70 MIN

Regressão do mecanismo e retirada do workaround

Transforma uma reprodução local em critérios de correção, mantendo risco residual, limites e responsabilidades visíveis.

Separar recuperação e remoção do defeito

Recriar o pool disponibiliza recursos novos e permite uma operação, mas a mesma sequência defeituosa volta a reter três ligações. Aumentar a capacidade para cinco conserva duas livres depois das primeiras três falhas; depois da quinta, também esgota. O efeito temporário pode ter valor para concluir um lote fictício, desde que autorizado e proporcional ao risco. Regista aplicabilidade, custos, impacto, evidência a preservar e critérios de interrupção. Não declares causa removida porque o último lote terminou. A decisão pode manter uma correção com responsável ou aceitar risco temporário segundo a governança aplicável. O sponsor fornece prioridades, mas o pedido de encerrar um registo não substitui os critérios técnicos e a autoridade definida para aceitar o risco residual.

Exercer o desencadeador e o invariante

A regressão corrigida alterna 30 sucessos, 30 exceções e 30 cancelamentos. Após cada ciclo, três ligações ficam livres e nenhuma continua cedida. A exceção e o cancelamento não desaparecem: a alteração observada é a recuperação da capacidade sem alterar o resultado da tarefa. O grupo de concorrência acrescenta espera e reutilização; o grupo de ligação fechada verifica que contagem positiva não basta. Estes testes ligam o mecanismo às condições de aceitação. Noventa saídas são uma escolha da oficina, não uma prova estatística ou cobertura de todas as falhas. Guarda versão do código, driver, sequência, resultado esperado e observado. Quando um patch só passa sucesso, pede regressão dos percursos que originaram a recorrência em vez de mais volume do mesmo caminho.

Passar do laboratório ao produto afetado

Uma reprodução pequena pode tornar uma hipótese clara sem provar que o produto real falha da mesma forma. Para uma aplicação com WebSphere, JDBC ou Oracle, confirma versão, configuração do pool, contratos de close e cancelamento, transações e comportamento perante perda da dependência. O laboratório local não executou essas tecnologias. Define um ensaio autorizado com carga e percursos representativos, resultados funcionais, contagem de recursos e limites de exposição. Mantém critério de paragem e alternativa de recuperação enquanto avalias retirar o workaround. Um período sem incidentes pode coincidir com procura bloqueada ou ausência do desencadeador; documenta exposição. Se dois serviços têm o mesmo timeout mas um retém recursos e outro executa consultas longas, preserva investigações distintas até existir evidência de mecanismo comum.

Acompanhar resultados diferentes até à aceitação

Uma revisão pode identificar devolução omitida, teste sem cancelamento e alerta apenas de CPU. São fatores relacionados, mas exigem resultados diferentes: corrigir o mecanismo, impedir regressão e detetar impacto com sinais adequados. Um dashboard novo pode satisfazer a terceira ação sem completar as outras. Para cada ação, regista responsável, prazo, evidência e condição de aceitação; revê risco residual e capacidade com quem pode decidir. Atualiza a base de conhecimento por versão e preserva o histórico do workaround quando deixar de ser aplicável. Prepara em inglês uma revisão com fornecedor usando factos, lacunas e próximos testes. O guião inclui uma proposta de oficina, mas não foi executado por um grupo humano e não recebeu revisão independente de especialista.

python3 - <<'PY'
import json
from pathlib import Path
e=json.loads(Path('content/labs/problem-runtime/evidence.json').read_text())
for name in ['recreationDoesNotFixLeak','largerPoolDelaysExhaustion','repeatedExitPaths']:
    print(name, e['checks'][name])
PY
NA PRÁTICA

Recriar ou aumentar o pool permite avançar temporariamente, mas repetir o desencadeador volta a consumir a capacidade.

Armadilhas comuns

Confundir workaround com correção, noventa saídas com cobertura integral ou dashboard entregue com todas as ações eficazes.

Tópicos relacionados: Investigação e evidência · Workarounds e aceitação de correções

Leva esta ideia contigo

Aceita resultados demonstrados no âmbito certo e mantém investigação ou risco formalmente acompanhado onde a evidência ainda falta.

Criar conta

Referência: OPS11-BP02 Perform post-incident analysis · Problem management practices 2026-09; ServiceNow Brazil examples with scoped plugins and properties