Impacto antes de severidade automática
Começa pelo serviço afetado, operações que falham, utilizadores ou processos impactados, início conhecido e prazo de negócio. Um alerta técnico não define sozinho a severidade. Uma falha em homologação e uma falha no corte de pagamentos podem ter sintomas iguais e impactos diferentes. Aplica a matriz da organização e atualiza a classificação quando a informação muda.
Uma coordenação, várias competências
Define quem coordena a resposta, quem lidera a investigação operacional e quem mantém as partes interessadas informadas. Uma pessoa pode acumular papéis num incidente pequeno, mas os papéis continuam a existir. Mantém uma linha temporal partilhada com hipóteses, ações e resultados. Evita intervenções simultâneas não coordenadas que tornam impossível atribuir efeitos e aumentam o risco.
Comunicar factos e incerteza
Uma atualização deve dizer impacto confirmado, início ou janela conhecida, mitigação em curso e momento da próxima atualização. Distingue causa confirmada de hipótese. Não inventes uma hora de recuperação só para preencher um campo. É possível comprometer uma próxima atualização mesmo quando ainda não existe uma estimativa de recuperação defensável.
Aplicação no trabalho
Num incidente fictício às 06:10, distingue o serviço indisponível do componente que gerou o alerta. Regista operações afetadas, cutoff e alternativa de negócio. Combina uma cadência de comunicação com o responsável e mantém alguém disponível para executar decisões autorizadas. Uma pergunta sem resposta deve ficar visível, com responsável e próximo momento de avaliação.
“Desde 06:10 UTC, o processamento de valorização está atrasado para três fundos. A equipa investiga espera na base de dados; a causa não está confirmada. Não há evidência de perda de dados. Próxima atualização às 06:30 UTC.” Esta mensagem evita confundir hipótese, impacto e garantia.
Armadilhas comuns
Classificar só pela mensagem; prometer recuperação sem base.
Tópicos relacionados: Investigar por hipóteses e dependências · Recuperar cadeias batch sem falsificar sucesso
Severidade deriva do impacto e do contexto; coordenação permite recuperar com decisões rastreáveis.
Referência: Incident response · DR Production Support L3 2026.4; Linux, JDK 25 HotSpot, OpenSSL 3.5 and Kubernetes examples require installed-version checks