Conceito e mecanismo
Um Incident Manager organiza a resposta quando a degradação exige coordenação entre pessoas, equipas ou decisões. O título não significa que seja o especialista de todos os componentes, nem que possa aceitar qualquer risco em nome da organização. Define previamente quem pode declarar um incidente, como convocar participantes e quais critérios de impacto orientam a prioridade. A quantidade de alertas não mede por si só o impacto: cem alertas de um único componente podem corresponder a uma só falha, enquanto um único ficheiro em falta pode comprometer uma entrega crítica. Regista o que se sabe, o que ainda está por confirmar e como o impacto está a evoluir.
Aplicação guiada
Num exemplo fictício, um batch de fundos falha às 16:10 e a entrega acordada é às 17:00. O servidor está disponível, mas o resultado esperado não foi produzido. Confirma serviços afetados, utilizadores ou processos dependentes, margem até ao prazo e alternativas de recuperação. Se é necessária coordenação de APS, base de dados e negócio, ativa o processo aplicável sem esperar por causa completa. A gravidade deve seguir a matriz local, não números copiados de um fornecedor. Reavalia-a com evidência nova e explica alterações. A prioridade prática é reduzir o impacto preservando uma resposta organizada e uma base factual para decisões posteriores.
Faltam 50 minutos para o prazo, mas isso não representa automaticamente 50 minutos disponíveis para qualquer recuperação.
Armadilhas comuns
Prioridade pelo número de alertas; esperar pela causa; copiar níveis SEV externos; confundir servidor disponível com entrega concluída.
Tópicos relacionados: Comando, delegação e estado partilhado · Comunicação e incerteza · Decisões de mitigação e evidência
Classifica pelo impacto real e esperado, usando critérios locais e incerteza explícita.
Referência: Severity Levels · Google SRE incident guidance; PagerDuty contextual incident model; NIST SP 800-61 Rev. 3 April 2025; editorial review 2026-10-01