Conceito e mecanismo
A fiabilidade precisa de ser discutida em termos de experiência do utilizador e consequências para o negócio. Um indicador de serviço mede uma propriedade observada; o objetivo define o nível pretendido num período. A política de utilização do error budget ajuda a decidir quando privilegiar estabilidade ou evolução, mas tem de ser acordada no contexto do serviço. O gestor apoia decisões com dados e pessoas adequadas, sem inventar uma regra universal de parar todas as mudanças. Durante incidentes, respeita papéis de coordenação e canais de comunicação definidos. Assumir o comando técnico por ser o gestor pode duplicar ordens e retirar atenção a quem está a recuperar o serviço.
Aplicação guiada
Depois de um incidente fictício de batch, a primeira reação é atribuir culpa a quem executou o último comando. Um postmortem útil reconstrói o que era conhecido, a sequência, condições contribuintes e proteções que faltavam. A aprendizagem sem culpa não elimina factos, responsabilidades de seguimento ou necessidade de melhorar. Acorda ações concretas, responsáveis e critérios de conclusão, priorizadas pelo efeito esperado. Verifica se as ações alteram realmente a capacidade de detetar, recuperar ou prevenir recorrência. “Ter mais cuidado” não descreve uma mudança de sistema verificável. Protege a possibilidade de reportar dúvidas e sinais precoces; se más notícias forem punidas, a gestão pode receber relatórios tranquilos enquanto o risco aumenta.
Uma ação deve alterar uma condição e permitir verificar o resultado.
Armadilhas comuns
Gestor como comando paralelo; culpa como causa completa; ações sem dono; regras de fiabilidade inventadas.
Tópicos relacionados: Mandato, autonomia e delegação · Feedback e desenvolvimento de competências · Capacidade, carga operacional e toil
Apoia recuperação coordenada e converte aprendizagem em mudanças verificáveis.
Referência: Postmortem culture learning from failure · GitLab Handbook 2026; DORA current five-metric model; SRE and engineering guidance reviewed 2026-09-30