Conceito e mecanismo
Um alarme só é útil se observar a série certa e produzir uma reação adequada. Regista namespace, nome, dimensões, estatística, período e tratamento de dados ausentes. A substituição de uma instância pode deixar um alarme a observar um identificador antigo. CPU baixa não exclui pressão de memória, espera por disco ou bloqueio numa dependência. O CloudWatch agent permite recolher métricas do sistema operativo e logs, mas instalação, configuração, autorização e entrega precisam de validação. Um sinal ausente não deve ser interpretado automaticamente como aplicação saudável. A política de missing data depende do significado da métrica e das consequências da ação associada.
Aplicação guiada
No diagnóstico, escolhe a fonte segundo a pergunta. CloudTrail ajuda a investigar chamadas de gestão; AWS Config compara configurações com regras; logs da aplicação mostram o processamento observado. Nenhuma destas fontes substitui todas as outras. Uma avaliação NON_COMPLIANT não comprova remediação, e um trail só de management events não documenta automaticamente leituras de objetos S3. Se SSM está offline, correlaciona estado e logs do agente com DNS e HTTPS de saída para os endpoints aplicáveis. Testa também a chegada da notificação à equipa: criar um alarme não demonstra que existe alguém capaz de receber e executar a resposta durante a noite.
O batch termina por OOM com CPU a32%. Verifica memória do guest e a instância referenciada pelo alarme antes de concluir que existe capacidade suficiente.
Armadilhas comuns
Confundir ausência com zero; confiar em dimensões antigas; corrigir apenas a notificação quando a série está errada.
Tópicos relacionados: Continuidade e recuperação utilizável · Mudanças, drift e automação controlada · Autorização, chaves e consumidores de segredos
Demonstra recolha, avaliação, entrega e resposta como uma cadeia completa.
Referência: CloudWatch agent telemetry collection · SOA-C02 archived guide v2.3; retired2025-09-29