← Voltar ao catálogo
Avaliação profissional

Gestão de Incidentes: coordenar e recuperar

Doze aulas, 100 perguntas e 20 casos sobre diagnóstico, mitigação, recuperação parcial, qualidade da evidência e passagem para RUN.

DRDisponível
DRINC12 aulas

Objetivos e percurso

Percurso técnico de doze módulos com exemplos fictícios de APS. Inclui modelos de cronologia e coordenação, laboratório HTTP/SQLite com confirmação perdida após commit e repetição concorrente, e análise de dados sintéticos por grupo, janela e cardinalidade. As novas oficinas ligam observações a decisões de mitigação limitada, compatibilidade de rollback e aceitação operacional. Treze grupos de análise passaram duas vezes, com SQL e resultados guardados. Avaliação interna de 62 decisões em 130 minutos. Quantidades atingidas não substituem prática em equipa, ensaios representativos e revisão independente, ainda pendentes.

Para quem: Equipas APS L2/L3, infraestrutura, SRE, administração de sistemas e gestores técnicos.

Pré-requisitos: Noções de aplicações, monitorização e suporte à produção; não pressupõe processos internos de qualquer banco.

770 minutos de estudo estimados

  • Identifica o serviço afetado e decide quando mobilizar resposta coordenada.
  • Organiza equipas e alterações para manter uma resposta coerente.
  • Testa hipóteses e reduz impacto com ações proporcionais e verificáveis.
  • Comunica impacto e incerteza e mantém uma cronologia útil.
  • Transfere responsabilidade e valida o serviço antes de declarar recuperação.
  • Converte o incidente em melhorias acompanhadas e verificáveis.
  • Mede impacto e trabalho pendente, atualiza previsões quando as condições mudam e comunica o alcance de uma mitigação.
  • Mantém decisões rastreáveis e continuidade entre equipas, usando um guião de simulação com mudanças de contexto.
  • Observa falhas HTTP controladas e compara o estado do processo, da operação e da confirmação do cliente.
  • Coordena a retoma do serviço e o tratamento de resultados anteriores sem confundir mitigação com encerramento.
  • Investiga falhas escondidas por agregação, filtros, ausência de amostra e chegada tardia de evidência.
  • Escolhe uma mitigação com exposição limitada e distingue avanço do ensaio, recuperação funcional e aceitação operacional.

Módulos

  1. Triagem e impacto
  2. Coordenação e responsabilidades
  3. Diagnóstico e mitigação
  4. Comunicação e evidência
  5. Passagem de turno e recuperação
  6. Aprendizagem e prevenção
  7. Impacto, backlog e previsões
  8. Estado, handover e exercício de coordenação
  9. Laboratório HTTP e resultados incertos
  10. Recuperação parcial e reconciliação
  11. Impacto por grupo e qualidade dos dados
  12. Comparação controlada e aceitação da mitigação

Continua a aprender

Avaliações técnicas

Referências e versão

Incident management practices 2026-09; scoped Google SRE, PagerDuty and Atlassian examples

O que vais explorar

0 / 12
01

Triagem e impacto

Identifica o serviço afetado e decide quando mobilizar resposta coordenada.

40 min
02

Coordenação e responsabilidades

Organiza equipas e alterações para manter uma resposta coerente.

40 min
03

Diagnóstico e mitigação

Testa hipóteses e reduz impacto com ações proporcionais e verificáveis.

40 min
04

Comunicação e evidência

Comunica impacto e incerteza e mantém uma cronologia útil.

40 min
05

Passagem de turno e recuperação

Transfere responsabilidade e valida o serviço antes de declarar recuperação.

40 min
06

Aprendizagem e prevenção

Converte o incidente em melhorias acompanhadas e verificáveis.

40 min
07

Impacto, backlog e previsões

Mede impacto e trabalho pendente, atualiza previsões quando as condições mudam e comunica o alcance de uma mitigação.

60 min
08

Estado, handover e exercício de coordenação

Mantém decisões rastreáveis e continuidade entre equipas, usando um guião de simulação com mudanças de contexto.

60 min
09

Laboratório HTTP e resultados incertos

Observa falhas HTTP controladas e compara o estado do processo, da operação e da confirmação do cliente.

70 min
10

Recuperação parcial e reconciliação

Coordena a retoma do serviço e o tratamento de resultados anteriores sem confundir mitigação com encerramento.

70 min
11

Impacto por grupo e qualidade dos dados

Investiga falhas escondidas por agregação, filtros, ausência de amostra e chegada tardia de evidência.

70 min
12

Comparação controlada e aceitação da mitigação

Escolhe uma mitigação com exposição limitada e distingue avanço do ensaio, recuperação funcional e aceitação operacional.

70 min

Aprender também é experimentar.

Perguntas originais com explicações, cartões de revisão e cenários para aplicar os conceitos.

Praticar
Este módulo trabalha fundamentos. Não é um curso completo de certificação nem uma simulação integral do exame oficial.