Disaster Recovery: preparar, recuperar e validar
Doze aulas, 100 perguntas e vinte cenários sobre recuperação, integridade, snapshots, caches, continuidade dos consumidores e aceitação operacional.
Objetivos e percurso
Percurso técnico com doze módulos e exemplos fictícios de APS. Seis oficinas aprofundam restauro, reconciliação, snapshots etcd, revisões, reconstrução de caches, continuidade e aceitação. Um laboratório SQLite 3.53.4 executa oito grupos; dois laboratórios etcd 3.6.15 executam dez grupos cada, incluindo um consumidor didático em memória. Os exemplos PostgreSQL, AWS e Azure continuam conceptuais. Código completo e oficinas de comunicação em inglês publicados. Avaliação interna de 62 decisões em 130 minutos. Os limites quantitativos inferiores do banco técnico maduro estão cumpridos; continuam pendentes integração representativa, persistência de checkpoints, capacidade, prática acompanhada e revisão especializada independente.
Para quem: Equipas APS L2/L3, infraestrutura, SRE, administração de sistemas e gestores técnicos.
Pré-requisitos: Noções de armazenamento, aplicações, identidade e alta disponibilidade; os exemplos indicam versões e condições.
730 minutos de estudo estimados
- Separa RTO e RPO e verifica se a cadeia de dependências permite cumprir ambos.
- Relaciona prontidão do ambiente alternativo com recuperação histórica e controlo de alterações.
- Valida a cadeia de recuperação e os limites da verificação de ficheiros.
- Inclui identidade, chaves, serviços e configuração no caminho de recuperação.
- Distingue restauro técnico, validação do serviço e controlo do impacto do ensaio.
- Controla autoridade, estado e proteção durante recuperação e failback.
- Distingue um ficheiro legível de um conjunto de dados recuperado, usando backups e contraexemplos executados localmente.
- Reconcilia efeitos que sobreviveram ao desastre e decide quando o serviço recuperado pode passar para operação.
- Executar um restauro etcd isolado, interpretar o ponto recuperado e distinguir integridade, identidade e aceitação de negócio.
- Observar revisão regressada, bump e compaction, e construir critérios de aceitação para consumidores e objetivos de recuperação.
- Reconstruir um consumidor didático após restauro etcd, validar origem e completude e recuperar alterações ocorridas antes da subscrição.
- Aplicar eventos coerentemente, observar falhas do handler e preparar critérios de persistência, capacidade e aceitação operacional.
Módulos
- Objetivos e dependências
- Estratégias e proteção dos dados
- Backups e pontos recuperáveis
- Preparação e configuração do destino
- Ensaios e validação funcional
- Ativação, reconciliação e regresso
- Restauro: ponto recuperado e integridade
- Retoma: replay e aceitação operacional
- Snapshot, identidade e ponto recuperado
- Revisões, watches e retoma controlada
- Reconstruir a cache e ligar o watch
- Lotes, checkpoints e aceitação do consumidor
Continua a aprender
Referências e versão
DR recovery 2026-09; PostgreSQL 18, etcd 3.6 and selected AWS/Azure behavior
- Plan for disaster recovery · 2026-09-30
- Define recovery objectives · 2026-10-04
- Recovery strategies and data disasters · 2026-09-30
- Test disaster recovery implementation · 2026-10-04
- Manage recovery-site configuration drift · 2026-09-30
- Automate recovery · 2026-10-04
- PostgreSQL18 continuous archiving and PITR · 2026-09-30
- PostgreSQL18 pg_verifybackup and restore-validation limits · 2026-09-30
- AWS Backup Vault Lock modes and limits · 2026-09-30
- AWS Backup restore testing · 2026-09-30
- Restore testing validation · 2026-10-03
- AWS Backup encryption and restore access · 2026-09-30
- Disaster recovery · 2026-10-04
- Azure Site Recovery test failover isolation · 2026-09-30
- Azure Site Recovery reprotection and failback · 2026-09-30
- SQLite Backup API · 2026-10-03
- Write-Ahead Logging · 2026-10-03
- PRAGMA statements · 2026-10-03
- SQLite official downloads · 2026-10-03
- sqlite3 Python 3.13 reference · 2026-10-03
- SQLite foreign key support · 2026-10-03
- Isolation in SQLite · 2026-10-03
- Maintenance · 2026-10-04
- Supported platforms · 2026-10-04
- etcd v3.6.15 release · 2026-10-04
- API guarantees · 2026-10-04
- Interacting with etcd · 2026-10-04
- etcd API · 2026-10-04
O que vais explorar
0 / 12Objetivos e dependências
Separa RTO e RPO e verifica se a cadeia de dependências permite cumprir ambos.
Estratégias e proteção dos dados
Relaciona prontidão do ambiente alternativo com recuperação histórica e controlo de alterações.
Backups e pontos recuperáveis
Valida a cadeia de recuperação e os limites da verificação de ficheiros.
Preparação e configuração do destino
Inclui identidade, chaves, serviços e configuração no caminho de recuperação.
Ensaios e validação funcional
Distingue restauro técnico, validação do serviço e controlo do impacto do ensaio.
Ativação, reconciliação e regresso
Controla autoridade, estado e proteção durante recuperação e failback.
Restauro: ponto recuperado e integridade
Distingue um ficheiro legível de um conjunto de dados recuperado, usando backups e contraexemplos executados localmente.
Retoma: replay e aceitação operacional
Reconcilia efeitos que sobreviveram ao desastre e decide quando o serviço recuperado pode passar para operação.
Snapshot, identidade e ponto recuperado
Executar um restauro etcd isolado, interpretar o ponto recuperado e distinguir integridade, identidade e aceitação de negócio.
Revisões, watches e retoma controlada
Observar revisão regressada, bump e compaction, e construir critérios de aceitação para consumidores e objetivos de recuperação.
Reconstruir a cache e ligar o watch
Reconstruir um consumidor didático após restauro etcd, validar origem e completude e recuperar alterações ocorridas antes da subscrição.
Lotes, checkpoints e aceitação do consumidor
Aplicar eventos coerentemente, observar falhas do handler e preparar critérios de persistência, capacidade e aceitação operacional.