Production Support L3: investigar e recuperar
Investiga incidentes, recupera batch e ficheiros e confirma resultados de negócio. Pratica comunicação, escalamento, reconciliação e automatização com limites.
Objetivos e percurso
Doze módulos preparam decisões de suporte de produção desde a triagem até à melhoria após o incidente. As aulas ligam hipóteses, batch, transferências, indicadores, passagem de turno e runbooks a exemplos fictícios de operações financeiras. O banco inclui perguntas de cálculo, respostas múltiplas e vinte cenários com restrições e alternativas. Inclui diagnóstico Linux, JVM, TLS e DNS, retries sob carga e interpretação de rollouts Kubernetes, observabilidade distribuída, controlo de acesso e limites de recuperação. AutoSys e Transfer CFT aparecem como contexto de ferramentas; comandos e códigos concretos devem ser confirmados na versão instalada. É uma avaliação de conhecimentos e decisões, não uma certificação externa nem uma demonstração prática de acesso a produção.
Para quem: Suporte L2/L3, Application Production Support e gestores técnicos com responsabilidades operacionais.
Pré-requisitos: Noções de sistemas, aplicações, logs e fluxos de dados. Recomenda-se familiaridade com Linux e middleware.
460 minutos de estudo estimados
- Interpretar cobertura de telemetria, percentis e recuperação com autoridade e integridade.
- Distinguir evidência de disco, logs, pressão de recursos, JVM, TLS e DNS.
- Controlar amplificação de retries e interpretar gates e condições de rollout.
- Relacionar impacto, urgência e coordenação da resposta.
- Investigar hipóteses e escalar com evidência que permita agir.
- Recuperar batch e ficheiros considerando estado parcial e duplicados.
- Validar resultados, passagem de turno e eficácia de ações preventivas.
Módulos
- Fazer triagem e organizar a resposta
- Investigar por hipóteses e dependências
- Recuperar cadeias batch sem falsificar sucesso
- Validar transferências e reconciliação
- Medir impacto e confirmar recuperação
- Transformar o incidente em melhoria verificável
- Passagem de turno e escalamento
- Runbooks que permitem decidir
- Diagnóstico Linux, JVM e conectividade
- Recuperação sob carga e após releases
- Observabilidade e evidência distribuída
- Acesso, mudança e limites de recuperação
Continua a aprender
Referências e versão
DR Production Support L3 2026.4; Linux, JDK 25 HotSpot, OpenSSL 3.5 and Kubernetes examples require installed-version checks
- Incident response · 2026-09-29
- Managing incidents · 2026-09-29
- Effective troubleshooting · 2026-09-29
- Monitoring distributed systems · 2026-09-29
- Implementing SLOs · 2026-09-29
- Alerting on SLOs · 2026-09-29
- Postmortem culture · 2026-09-29
- Postmortem practices · 2026-09-29
- Evolution of automation · 2026-09-29
- Being on-call · 2026-09-29
- AutoSys: success_codes and exit status · 2026-09-29
- Transfer CFT product overview · 2026-09-29
- Making retries safe with idempotent APIs · 2026-09-29
- Data processing pipelines · 2026-09-29
- Data integrity · 2026-09-29
- Process file descriptors · 2026-10-01
- Filesystem byte and inode usage · 2026-10-01
- Unlink and open file lifetime · 2026-10-01
- Journal selection and time display · 2026-10-01
- Pressure Stall Information · 2026-10-01
- Java diagnostic tools · 2026-10-01
- OpenSSL client diagnostics · 2026-10-01
- DNS resolution debugging · 2026-10-01
- Timeouts, retries, backoff and jitter · 2026-10-01
- Handling overload · 2026-10-01
- Deployment progress and availability · 2026-10-01
- Canary release evaluation · 2026-10-01
- Context propagation · 2026-10-01
- Sampling · 2026-10-01
- Query functions · 2026-10-01
- Histograms and summaries · 2026-10-01
- Metric and label naming · 2026-10-01
- Root cause analysis concepts · 2026-10-01
- Privileged Identity Management overview · 2026-10-01
- Handling sensitive data · 2026-10-01
- Configuring fencing in a Red Hat High Availability cluster · 2026-10-01
- Plan for Disaster Recovery · 2026-10-01
O que vais explorar
0 / 12Fazer triagem e organizar a resposta
Liga sintomas ao impacto de negócio e separa coordenação, comunicação e execução.
Investigar por hipóteses e dependências
Constrói um diagnóstico discriminante entre Linux, JVM, rede e base de dados.
Recuperar cadeias batch sem falsificar sucesso
Relaciona scheduler, exit codes, calendários e validação dos resultados.
Validar transferências e reconciliação
Separa transporte, receção, processamento e aceitação funcional.
Medir impacto e confirmar recuperação
Usa indicadores do serviço, objetivos e janelas de observação para decidir estabilidade.
Transformar o incidente em melhoria verificável
Constrói uma análise sem culpabilização e ações com dono, prazo e critério de eficácia.
Passagem de turno e escalamento
Transfere contexto e responsabilidade sem perder a continuidade.
Runbooks que permitem decidir
Desenha passos com pré-condições, limites e prova de recuperação.
Diagnóstico Linux, JVM e conectividade
Escolhe observações que distinguem falta de recursos, espera da aplicação e falhas de ligação.
Recuperação sob carga e após releases
Controla retries, capacidade e rollout antes de declarar a recuperação funcional.
Observabilidade e evidência distribuída
Interpreta traces, métricas e problemas sem confundir lacunas de observação com resultados do negócio.
Acesso, mudança e limites de recuperação
Planeia intervenções com autoridade, dados compatíveis e critérios verificáveis de recuperação.