Conceito e mecanismo
Uma automação sobre dezenas de alvos precisa de controlar a dimensão do impacto antes de acelerar execução. Define piloto, concorrência, limite de erros e critérios de saída. Em Systems Manager Automation, atingir o limite de erros impede novos arranques, mas execuções já em curso podem continuar e falhar. Um threshold zero não é cancelamento nem rollback global. A comunicação ao comité deve distinguir alvos concluídos, falhados, em curso e não iniciados. Registar só sucesso ou falha global esconde o trabalho de recuperação por recurso. Os comandos precisam de tratar estado parcial e preservar informação útil para uma repetição segura.
Aplicação guiada
Uma remediação AWS Config pode usar um snapshot de conformidade desatualizado. Antes de alterar, confirma se a condição ainda existe; uma operação idempotente deve evitar estragar um recurso já corrigido. Aprovação também precisa de âmbito explícito. O passo aws:approve em Systems Manager tem aprovadores autorizados e timeout, mas não suporta automações entre várias contas e Regiões. Não transportes automaticamente exemplos de uma conta para esse contexto. Por fim, distingue o programa de exame do ciclo de vida dos serviços. DOP-C02 ainda refere OpsWorks, embora a documentação assinale a retirada do serviço. Aprende a interpretar referências históricas sem recomendar esse serviço para uma instalação nova.
Com dez alvos em curso, o primeiro erro suspende novos arranques; os restantes precisam de acompanhamento individual.
Armadilhas comuns
Snapshot como estado atual; threshold como cancelamento; aprovação sem âmbito; referência no exame como disponibilidade do serviço.
Tópicos relacionados: Capacidade, resiliência e recuperação · Telemetria e alarmes úteis
Automatiza decisões com limites, verificações atuais e escalamento claro.
Referência: Automation rate controls · DOP-C02