Suporte L2: diagnosticar, mitigar e escalar
Onze aulas, 80 perguntas e 20 casos L2: diagnóstico, filas e retenção, runbooks, aceitação por percurso e continuidade operacional.
Objetivos e percurso
Percurso profissional com onze aulas e 100 decisões originais PT-PT/EN. Mantém diagnóstico por camadas, tempos, PostgreSQL e passagem de turno, e aprofunda estados pendentes de filas, retenção em DLQ, ordem funcional, runbooks, janelas de recuperação, probes, comparação de coortes e evidência de aceitação. Inclui oito novos modelos determinísticos executados localmente com dados fictícios, sem executar serviços AWS, Kubernetes, alterações em produção ou aprovações humanas. Os casos permitem praticar decisões de suporte e comunicação em inglês; a preparação não substitui os procedimentos e a autorização do ambiente de trabalho. Avaliação interna de 58 decisões em 120 minutos.
Para quem: Equipas APS L2/L3, infraestrutura, SRE, administração de sistemas e gestores técnicos.
Pré-requisitos: Noções de aplicações, monitorização e suporte à produção; não pressupõe processos internos de qualquer banco.
660 minutos de estudo estimados
- Distingue sintomas, impacto e urgência para organizar a resposta.
- Constrói um diagnóstico reproduzível sem expor dados sensíveis.
- Interpreta estados de serviço, DNS, HTTP, TLS e recursos.
- Escolhe ações controladas e demonstra que o serviço recuperou.
- Entrega contexto acionável e mantém os interlocutores informados.
- Mantém continuidade e converte incidentes em ações verificáveis.
- Localiza a observação entre cliente, ligação e dependências sem confundir correlação com causa.
- Transforma logs e projeções limitadas numa escalada clara, validação funcional e passagem de responsabilidade.
- Reconcilia estados de trabalho, interpreta retenção e prepara recuperação sem confundir fila vazia com resultado concluído.
- Verifica alvo e pré-condições, calcula a janela completa e distingue autorização, execução, validação e recuperação.
- Avalia coortes, atualidade da observação e dados pendentes antes de comunicar recuperação e aceitar uma melhoria operacional.
Módulos
- Triagem orientada ao impacto
- Hipóteses e evidências úteis
- Diagnóstico por camada
- Mitigação e validação operacional
- Escalada e comunicação em inglês
- Passagem de turno e melhoria
- Diagnóstico por camadas com evidência
- Cronologia, recuperação e passagem L2
- Filas, quarentena e prazos funcionais
- Runbooks, âmbito e recuperação controlada
- Aceitação por percurso e melhoria L2
Continua a aprender
Referências e versão
Operational support; PostgreSQL 18, OpenSSL 3.5 and BIND 9.20.29 examples; reviewed 2026-09-30
- Effective troubleshooting · 2026-09-30
- Incident response · 2026-10-02
- Postmortem culture · 2026-09-30
- systemctl manual · 2026-09-30
- journalctl manual · 2026-10-02
- df manual · 2026-09-30
- curl command line manual · 2026-10-02
- openssl s_client · 2026-09-30
- BIND dig manual · 2026-09-30
- Monitoring database activity · 2026-10-02
- Viewing locks · 2026-09-30
- Logging cheat sheet · 2026-10-02
- Pod lifecycle · 2026-09-30
- Debug pods · 2026-09-30
- Timeouts retries and backoff with jitter · 2026-10-02
- System Information Functions and Operators · 2026-10-02
- Available CloudWatch metrics for Amazon SQS · 2026-10-02
- Using dead-letter queues in Amazon SQS · 2026-10-02
- Monitoring distributed systems · 2026-10-02
- The evolution of automation at Google · 2026-10-02
- Canarying releases · 2026-10-02
- Liveness, readiness and startup probes · 2026-10-02
- Eliminating toil · 2026-10-02
O que vais explorar
0 / 11Triagem orientada ao impacto
Distingue sintomas, impacto e urgência para organizar a resposta.
Hipóteses e evidências úteis
Constrói um diagnóstico reproduzível sem expor dados sensíveis.
Diagnóstico por camada
Interpreta estados de serviço, DNS, HTTP, TLS e recursos.
Mitigação e validação operacional
Escolhe ações controladas e demonstra que o serviço recuperou.
Escalada e comunicação em inglês
Entrega contexto acionável e mantém os interlocutores informados.
Passagem de turno e melhoria
Mantém continuidade e converte incidentes em ações verificáveis.
Diagnóstico por camadas com evidência
Localiza a observação entre cliente, ligação e dependências sem confundir correlação com causa.
Cronologia, recuperação e passagem L2
Transforma logs e projeções limitadas numa escalada clara, validação funcional e passagem de responsabilidade.
Filas, quarentena e prazos funcionais
Reconcilia estados de trabalho, interpreta retenção e prepara recuperação sem confundir fila vazia com resultado concluído.
Runbooks, âmbito e recuperação controlada
Verifica alvo e pré-condições, calcula a janela completa e distingue autorização, execução, validação e recuperação.
Aceitação por percurso e melhoria L2
Avalia coortes, atualidade da observação e dados pendentes antes de comunicar recuperação e aceitar uma melhoria operacional.