Suporte de aplicações em produção
Dez aulas, 80 perguntas e 20 casos de APS: serviço, diagnóstico, batches, recuperação, aceitação, capacidade e melhoria.
Objetivos e percurso
Percurso profissional de dez módulos com situações fictícias de banca e operações. Quatro oficinas aprofundam reconciliação, replay, passagem de turno, autonomia RUN, recuperação, aceitação, capacidade variável, custo e melhoria contínua. Dois laboratórios locais distinguem execução CSV/SQLite/datetime de modelos sintéticos. Avaliação interna de 54 decisões em 120 minutos. Prática autorizada com sistemas reais, sessão humana, revisão independente e feedback continuam necessários.
Para quem: Equipas APS L2/L3 e gestores de projetos técnicos com responsabilidade de produção.
Pré-requisitos: Noções de aplicações, infraestrutura, logs e fluxos de dados. Os casos fornecem os dados necessários.
570 minutos de estudo estimados
- Traduz um alerta técnico num impacto funcional com dono e prioridade.
- Avalia indicadores, distribuição de latência e lacunas de recolha.
- Coordena recuperação e preserva continuidade entre equipas.
- Protege completude e consistência ao recuperar processamentos.
- Liga a decisão de release a evidência representativa e recuperação viável.
- Converte lacunas operacionais em aceitação, melhorias e trabalho de projeto.
- Interpreta resultados locais de batches, distingue confirmação de efeito e decide o âmbito seguro de uma repetição.
- Constrói uma passagem de turno utilizável e critérios de aceitação ligados à capacidade real de operar o serviço.
- Valida dados, compatibilidade e contexto de execução antes de aceitar uma recuperação ou passagem para RUN.
- Revê previsões de recuperação e benefícios de melhoria com população, custos e trabalho residual explícitos.
Módulos
- O serviço, o impacto e a responsabilidade
- Medir o que o utilizador recebe
- Incidentes, comunicação e mudança de turno
- Batch, ficheiros e reconciliação
- Mudanças, canary e recuperação
- Autonomia de RUN e melhoria contínua
- Reconciliação, replay e commit
- Evidência, passagem e autonomia de RUN
- Aceitação e recuperação operacional
- Capacidade, custo e melhoria de APS
Continua a aprender
Referências e versão
DR APS professional curriculum 2026-09; vendor-neutral operational guidance reviewed 2026-09-30
- Monitoring Distributed Systems · 2026-09-30
- Effective Troubleshooting · 2026-10-03
- Incident Response · 2026-09-30
- Implementing SLOs · 2026-09-30
- Alerting on SLOs · 2026-09-30
- Release Engineering · 2026-09-30
- Data Integrity: What You Read Is What You Wrote · 2026-09-30
- Eliminating Toil · 2026-10-03
- Canarying Releases · 2026-10-03
- Reliable Product Launches at Scale · 2026-09-30
- Service Level Objectives · 2026-10-03
- Making retries safe with idempotent APIs · 2026-10-03
- Use runbooks to perform procedures · 2026-10-03
- Use playbooks to investigate issues · 2026-10-03
- Data Processing Pipelines · 2026-10-03
- Being On-Call · 2026-09-30
- Postmortem Culture: Learning from Failure · 2026-09-30
- Implement a decommissioning process · 2026-10-03
- Managing Incidents · 2026-10-03
- CSV file reading and writing · 2026-10-03
- Transactions · 2026-10-03
- sqlite3 database interface · 2026-10-03
- The ON CONFLICT clause · 2026-10-03
- Basic date and time types · 2026-10-03
- Consistent review of operational readiness · 2026-10-03
- The Evolving SRE Engagement Model · 2026-10-03
- Handling Overload · 2026-10-03
- SQLite Backup API · 2026-10-03
- PRAGMA statements · 2026-10-03
- Allocate costs based on workload metrics · 2026-10-03
- Logging Cheat Sheet · 2026-10-03
O que vais explorar
0 / 10O serviço, o impacto e a responsabilidade
Traduz um alerta técnico num impacto funcional com dono e prioridade.
Medir o que o utilizador recebe
Avalia indicadores, distribuição de latência e lacunas de recolha.
Incidentes, comunicação e mudança de turno
Coordena recuperação e preserva continuidade entre equipas.
Batch, ficheiros e reconciliação
Protege completude e consistência ao recuperar processamentos.
Mudanças, canary e recuperação
Liga a decisão de release a evidência representativa e recuperação viável.
Autonomia de RUN e melhoria contínua
Converte lacunas operacionais em aceitação, melhorias e trabalho de projeto.
Reconciliação, replay e commit
Interpreta resultados locais de batches, distingue confirmação de efeito e decide o âmbito seguro de uma repetição.
Evidência, passagem e autonomia de RUN
Constrói uma passagem de turno utilizável e critérios de aceitação ligados à capacidade real de operar o serviço.
Aceitação e recuperação operacional
Valida dados, compatibilidade e contexto de execução antes de aceitar uma recuperação ou passagem para RUN.
Capacidade, custo e melhoria de APS
Revê previsões de recuperação e benefícios de melhoria com população, custos e trabalho residual explícitos.