Gestão de Incidentes: coordenar e recuperar
Doze aulas, 100 perguntas e 20 casos sobre diagnóstico, mitigação, recuperação parcial, qualidade da evidência e passagem para RUN.
Objetivos e percurso
Percurso técnico de doze módulos com exemplos fictícios de APS. Inclui modelos de cronologia e coordenação, laboratório HTTP/SQLite com confirmação perdida após commit e repetição concorrente, e análise de dados sintéticos por grupo, janela e cardinalidade. As novas oficinas ligam observações a decisões de mitigação limitada, compatibilidade de rollback e aceitação operacional. Treze grupos de análise passaram duas vezes, com SQL e resultados guardados. Avaliação interna de 62 decisões em 130 minutos. Quantidades atingidas não substituem prática em equipa, ensaios representativos e revisão independente, ainda pendentes.
Para quem: Equipas APS L2/L3, infraestrutura, SRE, administração de sistemas e gestores técnicos.
Pré-requisitos: Noções de aplicações, monitorização e suporte à produção; não pressupõe processos internos de qualquer banco.
770 minutos de estudo estimados
- Identifica o serviço afetado e decide quando mobilizar resposta coordenada.
- Organiza equipas e alterações para manter uma resposta coerente.
- Testa hipóteses e reduz impacto com ações proporcionais e verificáveis.
- Comunica impacto e incerteza e mantém uma cronologia útil.
- Transfere responsabilidade e valida o serviço antes de declarar recuperação.
- Converte o incidente em melhorias acompanhadas e verificáveis.
- Mede impacto e trabalho pendente, atualiza previsões quando as condições mudam e comunica o alcance de uma mitigação.
- Mantém decisões rastreáveis e continuidade entre equipas, usando um guião de simulação com mudanças de contexto.
- Observa falhas HTTP controladas e compara o estado do processo, da operação e da confirmação do cliente.
- Coordena a retoma do serviço e o tratamento de resultados anteriores sem confundir mitigação com encerramento.
- Investiga falhas escondidas por agregação, filtros, ausência de amostra e chegada tardia de evidência.
- Escolhe uma mitigação com exposição limitada e distingue avanço do ensaio, recuperação funcional e aceitação operacional.
Módulos
- Triagem e impacto
- Coordenação e responsabilidades
- Diagnóstico e mitigação
- Comunicação e evidência
- Passagem de turno e recuperação
- Aprendizagem e prevenção
- Impacto, backlog e previsões
- Estado, handover e exercício de coordenação
- Laboratório HTTP e resultados incertos
- Recuperação parcial e reconciliação
- Impacto por grupo e qualidade dos dados
- Comparação controlada e aceitação da mitigação
Continua a aprender
Referências e versão
Incident management practices 2026-09; scoped Google SRE, PagerDuty and Atlassian examples
- Managing Incidents · 2026-10-04
- Incident response · 2026-10-03
- Effective Troubleshooting · 2026-10-04
- Postmortem Culture · 2026-10-04
- Incident state document example · 2026-10-04
- Severity definitions and coordinated response · 2026-09-30
- Incident roles and scalable responsibility · 2026-09-30
- Coordinated investigation and repair · 2026-09-30
- External Communication Guidelines · 2026-10-04
- Impact timeline and follow-up records · 2026-09-30
- Subteams and span of control · 2026-09-30
- Incident and response-process review · 2026-09-30
- Recording decisions actions and follow-up · 2026-09-30
- Escalation fatigue and role conflicts · 2026-09-30
- Incident assessment escalation and communications · 2026-09-30
- Handling overload · 2026-10-03
- Addressing cascading failures · 2026-10-03
- Monitoring Distributed Systems · 2026-10-04
- Postmortem culture: learning from failure · 2026-10-03
- datetime: basic date and time types · 2026-10-03
- time: time access and conversions · 2026-10-03
- fractions: rational numbers · 2026-10-03
- Making retries safe with idempotent APIs · 2026-10-04
- Python http.server · 2026-10-04
- Python sqlite3 transactions · 2026-10-04
- Monitoring · 2026-10-04
- Implementing SLOs · 2026-10-04
- Canarying Releases · 2026-10-04
- Built-in Aggregate Functions · 2026-10-04
- SELECT · 2026-10-04
- SQL Language Expressions · 2026-10-04
- Ensuring rollback safety during deployments · 2026-10-04
O que vais explorar
0 / 12Triagem e impacto
Identifica o serviço afetado e decide quando mobilizar resposta coordenada.
Coordenação e responsabilidades
Organiza equipas e alterações para manter uma resposta coerente.
Diagnóstico e mitigação
Testa hipóteses e reduz impacto com ações proporcionais e verificáveis.
Comunicação e evidência
Comunica impacto e incerteza e mantém uma cronologia útil.
Passagem de turno e recuperação
Transfere responsabilidade e valida o serviço antes de declarar recuperação.
Aprendizagem e prevenção
Converte o incidente em melhorias acompanhadas e verificáveis.
Impacto, backlog e previsões
Mede impacto e trabalho pendente, atualiza previsões quando as condições mudam e comunica o alcance de uma mitigação.
Estado, handover e exercício de coordenação
Mantém decisões rastreáveis e continuidade entre equipas, usando um guião de simulação com mudanças de contexto.
Laboratório HTTP e resultados incertos
Observa falhas HTTP controladas e compara o estado do processo, da operação e da confirmação do cliente.
Recuperação parcial e reconciliação
Coordena a retoma do serviço e o tratamento de resultados anteriores sem confundir mitigação com encerramento.
Impacto por grupo e qualidade dos dados
Investiga falhas escondidas por agregação, filtros, ausência de amostra e chegada tardia de evidência.
Comparação controlada e aceitação da mitigação
Escolhe uma mitigação com exposição limitada e distingue avanço do ensaio, recuperação funcional e aceitação operacional.