← Voltar ao catálogo
Avaliação profissional

Production Support L3: investigar e recuperar

Investiga incidentes, recupera batch e ficheiros e confirma resultados de negócio. Pratica comunicação, escalamento, reconciliação e automatização com limites.

DRDisponível
DRL312 aulas

Objetivos e percurso

Doze módulos preparam decisões de suporte de produção desde a triagem até à melhoria após o incidente. As aulas ligam hipóteses, batch, transferências, indicadores, passagem de turno e runbooks a exemplos fictícios de operações financeiras. O banco inclui perguntas de cálculo, respostas múltiplas e vinte cenários com restrições e alternativas. Inclui diagnóstico Linux, JVM, TLS e DNS, retries sob carga e interpretação de rollouts Kubernetes, observabilidade distribuída, controlo de acesso e limites de recuperação. AutoSys e Transfer CFT aparecem como contexto de ferramentas; comandos e códigos concretos devem ser confirmados na versão instalada. É uma avaliação de conhecimentos e decisões, não uma certificação externa nem uma demonstração prática de acesso a produção.

Para quem: Suporte L2/L3, Application Production Support e gestores técnicos com responsabilidades operacionais.

Pré-requisitos: Noções de sistemas, aplicações, logs e fluxos de dados. Recomenda-se familiaridade com Linux e middleware.

460 minutos de estudo estimados

  • Interpretar cobertura de telemetria, percentis e recuperação com autoridade e integridade.
  • Distinguir evidência de disco, logs, pressão de recursos, JVM, TLS e DNS.
  • Controlar amplificação de retries e interpretar gates e condições de rollout.
  • Relacionar impacto, urgência e coordenação da resposta.
  • Investigar hipóteses e escalar com evidência que permita agir.
  • Recuperar batch e ficheiros considerando estado parcial e duplicados.
  • Validar resultados, passagem de turno e eficácia de ações preventivas.

Módulos

  1. Fazer triagem e organizar a resposta
  2. Investigar por hipóteses e dependências
  3. Recuperar cadeias batch sem falsificar sucesso
  4. Validar transferências e reconciliação
  5. Medir impacto e confirmar recuperação
  6. Transformar o incidente em melhoria verificável
  7. Passagem de turno e escalamento
  8. Runbooks que permitem decidir
  9. Diagnóstico Linux, JVM e conectividade
  10. Recuperação sob carga e após releases
  11. Observabilidade e evidência distribuída
  12. Acesso, mudança e limites de recuperação

Continua a aprender

Avaliações técnicas

Referências e versão

DR Production Support L3 2026.4; Linux, JDK 25 HotSpot, OpenSSL 3.5 and Kubernetes examples require installed-version checks

O que vais explorar

0 / 12
01

Fazer triagem e organizar a resposta

Liga sintomas ao impacto de negócio e separa coordenação, comunicação e execução.

20 min
02

Investigar por hipóteses e dependências

Constrói um diagnóstico discriminante entre Linux, JVM, rede e base de dados.

20 min
03

Recuperar cadeias batch sem falsificar sucesso

Relaciona scheduler, exit codes, calendários e validação dos resultados.

20 min
04

Validar transferências e reconciliação

Separa transporte, receção, processamento e aceitação funcional.

20 min
05

Medir impacto e confirmar recuperação

Usa indicadores do serviço, objetivos e janelas de observação para decidir estabilidade.

20 min
06

Transformar o incidente em melhoria verificável

Constrói uma análise sem culpabilização e ações com dono, prazo e critério de eficácia.

20 min
07

Passagem de turno e escalamento

Transfere contexto e responsabilidade sem perder a continuidade.

20 min
08

Runbooks que permitem decidir

Desenha passos com pré-condições, limites e prova de recuperação.

20 min
09

Diagnóstico Linux, JVM e conectividade

Escolhe observações que distinguem falta de recursos, espera da aplicação e falhas de ligação.

50 min
10

Recuperação sob carga e após releases

Controla retries, capacidade e rollout antes de declarar a recuperação funcional.

50 min
11

Observabilidade e evidência distribuída

Interpreta traces, métricas e problemas sem confundir lacunas de observação com resultados do negócio.

50 min
12

Acesso, mudança e limites de recuperação

Planeia intervenções com autoridade, dados compatíveis e critérios verificáveis de recuperação.

50 min

Aprender também é experimentar.

Perguntas originais com explicações, cartões de revisão e cenários para aplicar os conceitos.

Praticar
Percurso profissional independente com aulas e avaliação dos temas apresentados. Não atribui uma certificação externa e não substitui experiência prática supervisionada.

Temas da avaliação

Gestão de incidentes—
Investigação e evidência—
Batch e dependências—
Ficheiros e reconciliação—
Medição e recuperação—
Problemas e prevenção—
Passagem de turno e escalamento—
Runbooks e automatização—