Gestão de Problemas: investigar e prevenir
Doze aulas, 100 perguntas e 20 casos de gestão de problemas: evidência, recursos, transações, workarounds e aceitação de correções.
Objetivos e percurso
Percurso técnico de doze módulos com situações fictícias de APS. Mantém análise sintética, modelo sequencial e laboratório de tarefas asyncio com ligações SQLite; acrescenta conflitos entre escritores, leituras antigas, repetição, atomicidade e checkpoints reais sobre dados inventados. Os 15 grupos transacionais passaram duas vezes, com sequência SQL e resultados guardados. As decisões ligam o mecanismo à integridade do resultado, aos custos dos workarounds e à passagem para RUN. Avaliação interna de 62 decisões em 130 minutos. O limite quantitativo técnico inferior está atingido; ensaios representativos, prática humana e revisão independente continuam pendentes.
Para quem: Equipas APS L2/L3, infraestrutura, SRE, administração de sistemas e gestores técnicos.
Pré-requisitos: Noções de aplicações, monitorização e suporte à produção; não pressupõe processos internos de qualquer banco.
770 minutos de estudo estimados
- Define o problema pelo impacto e pela evidência, atribuindo responsabilidade à investigação.
- Compara hipóteses e identifica condições que explicam o comportamento observado.
- Torna conhecimento operacional reutilizável sem esconder limites ou risco residual.
- Distingue correção executada, mudança planeada e decisão de aceitar risco.
- Demonstra melhoria com exposição comparável, observabilidade e critérios definidos.
- Transforma conclusões em melhorias acompanhadas e aplicáveis a serviços relacionados.
- Reconstrói resultados de negócio e interpreta cronologias, taxas e percentis sem perder o âmbito da observação.
- Constrói uma cadeia de evidência entre hipótese, alteração e eficácia, usando um modelo limitado de fuga de recursos.
- Reproduz uma fuga de cedências com tarefas asyncio e ligações SQLite, distinguindo aquisição, uso e devolução.
- Transforma uma reprodução local em critérios de correção, mantendo risco residual, limites e responsabilidades visíveis.
- Reproduz conflitos entre transações e distingue espera por escritor, imagem de leitura antiga e repetição da decisão.
- Verifica o estado após falhas e relaciona transações longas, checkpoints e critérios de aceitação operacional.
Módulos
- Identificação e prioridade
- Investigação e evidência
- Workarounds e erros conhecidos
- Correção e risco aceite
- Validação e indicadores
- Aprendizagem e prevenção
- Evidência, populações e cronologia
- Hipóteses, regressão e fecho
- Ligações retidas e cancelamento
- Regressão do mecanismo e retirada do workaround
- Contenção e leituras desatualizadas
- Atomicidade, checkpoint e aceitação
Continua a aprender
Referências e versão
Problem management practices 2026-09; ServiceNow Brazil examples with scoped plugins and properties
- Problem investigation and contributing causes · 2026-09-30
- Problem ownership service ownership and investigation roles · 2026-09-30
- Linking incidents problems and corrective changes · 2026-09-30
- Iterative why questions and multiple contributing branches · 2026-09-30
- Known-error record context symptoms and workarounds · 2026-09-30
- Proactive investigation and diagnostic methods · 2026-09-30
- Investigation tasks change links and Accept Risk disposition · 2026-09-30
- Known-error article lifecycle and access · 2026-09-30
- Postmortem Culture: Learning from Failure · 2026-10-04
- Effective Troubleshooting · 2026-10-04
- Applying operational lessons across workloads · 2026-09-30
- OPS11-BP02 Perform post-incident analysis · 2026-10-04
- Scheduling intentional architecture improvements · 2026-09-30
- Conduct post-incident analysis · 2026-10-03
- datetime: basic date and time types · 2026-10-03
- Canarying Releases · 2026-10-04
- Monitoring Distributed Systems · 2026-10-04
- fractions: rational numbers · 2026-10-03
- Select and scale process variables · 2026-10-03
- Coroutines and tasks · 2026-10-04
- Queues · 2026-10-04
- sqlite3: DB-API interface · 2026-10-04
- Compound statements: try and finally · 2026-10-04
- asyncio exceptions · 2026-10-04
- Isolation In SQLite · 2026-10-04
- Transaction · 2026-10-04
- Result and Error Codes · 2026-10-04
- The ON CONFLICT Clause · 2026-10-04
- Write-Ahead Logging · 2026-10-04
- PRAGMA wal_checkpoint · 2026-10-04
- Set A Busy Timeout · 2026-10-04
O que vais explorar
0 / 12Identificação e prioridade
Define o problema pelo impacto e pela evidência, atribuindo responsabilidade à investigação.
Investigação e evidência
Compara hipóteses e identifica condições que explicam o comportamento observado.
Workarounds e erros conhecidos
Torna conhecimento operacional reutilizável sem esconder limites ou risco residual.
Correção e risco aceite
Distingue correção executada, mudança planeada e decisão de aceitar risco.
Validação e indicadores
Demonstra melhoria com exposição comparável, observabilidade e critérios definidos.
Aprendizagem e prevenção
Transforma conclusões em melhorias acompanhadas e aplicáveis a serviços relacionados.
Evidência, populações e cronologia
Reconstrói resultados de negócio e interpreta cronologias, taxas e percentis sem perder o âmbito da observação.
Hipóteses, regressão e fecho
Constrói uma cadeia de evidência entre hipótese, alteração e eficácia, usando um modelo limitado de fuga de recursos.
Ligações retidas e cancelamento
Reproduz uma fuga de cedências com tarefas asyncio e ligações SQLite, distinguindo aquisição, uso e devolução.
Regressão do mecanismo e retirada do workaround
Transforma uma reprodução local em critérios de correção, mantendo risco residual, limites e responsabilidades visíveis.
Contenção e leituras desatualizadas
Reproduz conflitos entre transações e distingue espera por escritor, imagem de leitura antiga e repetição da decisão.
Atomicidade, checkpoint e aceitação
Verifica o estado após falhas e relaciona transações longas, checkpoints e critérios de aceitação operacional.