← Gestão de Incidentes: coordenar e recuperar
01 / 12 · 40 MIN

Triagem e impacto

Identifica o serviço afetado e decide quando mobilizar resposta coordenada.

Conceito e mecanismo

A triagem transforma um sinal numa descrição de impacto que permite agir. Um alerta de CPU, uma chamada de utilizador e um batch atrasado são pontos de partida, não classificações automáticas de gravidade. Regista comportamento esperado, comportamento observado, início conhecido, operações afetadas e evolução. Separa factos de hipóteses e identifica o que ainda falta confirmar. Uma falha pequena na infraestrutura pode impedir uma operação crítica, enquanto muitos alertas podem descrever a mesma causa sem aumentar o número de clientes afetados. Usa a matriz de severidade acordada na organização. Os níveis SEV usados por PagerDuty ou Atlassian são exemplos dos seus processos, não regras universais nem políticas BNP Paribas.

Aplicação guiada

Num exemplo fictício, só uma fila está bloqueada, mas nela passam os ficheiros necessários a um cut-off. Não atribuas prioridade apenas pela percentagem de servidores saudáveis. Expõe prazo, dependências e consequência de não recuperar. Se forem necessárias várias equipas ou a resposta local não tiver capacidade suficiente, mobiliza coordenação sem esperar pela causa definitiva. A classificação pode ser revista à medida que surge evidência, mantendo registo da decisão. Evita gastar os primeiros minutos a discutir um rótulo enquanto o impacto cresce. Quando o âmbito é incerto, comunica essa incerteza e define uma verificação com responsável e prazo. Não apresentes um indicador interno como prova de que todas as operações dos clientes estão a funcionar.

NA PRÁTICA

Uma fila entre dezenas pode bloquear o único ficheiro necessário ao fecho diário.

Armadilhas comuns

Contar alertas como clientes; severidade de fornecedor como norma; esperar causa antes de coordenar.

Tópicos relacionados: Coordenação e responsabilidades · Diagnóstico e mitigação · Comunicação e evidência

Leva esta ideia contigo

Prioriza a consequência para o serviço com evidência e critérios acordados.

Criar conta

Referência: Severity definitions and coordinated response · Incident management practices 2026-09; scoped Google SRE, PagerDuty and Atlassian examples