Conceito e mecanismo
Uma métrica só é útil quando sabemos o que mede, de onde vem e qual série está a ser avaliada. CPU normal não demonstra espaço livre em /var. Métricas internas do sistema operativo exigem recolha apropriada, como o CloudWatch agent configurado com permissões e destinos corretos. Namespace, nome e dimensões identificam a série. Ao substituir uma instância, um alarme fixo no InstanceId anterior pode deixar de observar o recurso atual. Verifica datapoints recentes e o significado de cada dimensão antes de ajustar o threshold. Um gráfico com dados antigos não prova a situação presente.
Aplicação guiada
Define também o significado de ausência. Num heartbeat periódico, parar de publicar é um sinal relevante; numa contagem esparsa de erros, ausência pode ser normal. A escolha de tratamento deve corresponder ao sinal e ser ensaiada. Composite alarms correlacionam estados, mas não suportam diretamente todas as ações de um metric alarm, incluindo ações EC2 e Auto Scaling. Num handover APS, entrega o percurso completo de deteção: emissor, série, regra, ação, destinatário e resposta esperada. Ensaiar só a apresentação do dashboard deixa por provar a notificação e a capacidade de intervenção.
Depois de substituir EC2, confirma a série de ocupação de /var da nova instância e interrompe a publicação num ensaio controlado para avaliar a deteção.
Armadilhas comuns
Verde sem dados como saúde; CPU como ocupação de disco; alarmes fixos em recursos antigos; ação não suportada pelo tipo de alarme.
Tópicos relacionados: Desempenho e evidência operacional · Fiabilidade, escala e recuperação comprovada
Um alarme precisa de observar o recurso certo e ter comportamento conhecido quando o sinal desaparece.
Referência: CloudWatch alarms · SOA-C03; exam guide 1.1