Conceito e mecanismo
Systems Manager depende de um node gerido acessível pelo agente, com credenciais e conectividade adequadas. Numa EC2 privada, investiga estado do SSM Agent, role, resolução e acesso de saída aos endpoints necessários. Abrir SSH à Internet não corrige o caminho de gestão do agente. Um runbook operacional deve identificar os alvos com precisão: uma tag demasiado ampla pode transformar manutenção de um serviço numa ação sobre vários. Regista parâmetros e versão do runbook usados para que o resultado possa ser relacionado com a execução real. Os privilégios devem corresponder às ações delegadas, não ao conjunto de tarefas possíveis da equipa.
Aplicação guiada
Antes de uma alteração disruptiva, um passo aws:approve pode tornar executável a aprovação exigida, com aprovadores identificados e permissões corretas. Para vários alvos, configura concorrência e limite de erros coerentes com a exposição aceitável. Atingir esse limite interrompe novos envios, mas não desfaz instantaneamente execuções já em curso. Por isso acompanha todos os resultados e mantém uma recuperação definida. Um primeiro lote pequeno pode revelar uma hipótese errada antes de afetar todo o perímetro. No relatório ao PM, distingue alvos iniciados, concluídos, falhados e não executados; uma execução global parada não significa que todos ficaram inalterados.
Num patch por lotes, confirma dois alvos iniciais e o serviço após reinício antes de aumentar concorrência segundo o plano aprovado.
Armadilhas comuns
Tags sem revisão; aprovação só em comentário; limite de erros como undo; esquecer ações em curso depois da paragem.
Tópicos relacionados: Segurança na operação e recuperação · Rede, DNS e distribuição de conteúdo
Automação segura exige controlar o alcance e observar cada resultado.
Referência: Automation rate controls · SOA-C03; exam guide 1.1