Construir uma base de custo reconciliável
Começa pelo período e pela pergunta de gestão. Um custo amortizado distribui encargos de compromisso pelo período relevante; um gráfico unblended pode mostrar o pagamento inicial no dia da cobrança. Não compares bases diferentes para anunciar poupança. Regista moeda, contas, serviços, filtros, créditos e impostos incluídos. Tags aplicadas aos recursos precisam de ativação para alocação de custos, e os custos sem tag continuam a existir. Backfill pode recuperar o estado de ativação para períodos anteriores, mas não inventa valores de tags que nunca estiveram nos recursos. No caso fictício, uma tag foi atribuída em agosto e ativada depois; pedir dados desde junho não reconstrói junho e julho. Explicita a parcela não atribuída e acorda uma regra de repartição com os owners, sem a apresentar como medição direta da AWS.
Testar rightsizing contra o ciclo de negócio
CPU média baixa é uma pista, não uma autorização para reduzir memória. Uma JVM pode ter pressão de heap, GC ou dependências de I/O durante o fecho que não aparecem numa média diurna. Compute Optimizer pode usar memória recolhida pelo CloudWatch agent ou por integrações externas suportadas, incluindo Dynatrace. A recolha precisa do nome, namespace e dimensão esperados; num caso Linux com CWAgent, perder InstanceId impede a associação correta da métrica. Confirma o período observado e inclui o ciclo mensal e a condição de falha acordada. No exercício, uma frota passa de três workers de 400 unidades por minuto para dois. Com procura de 650, o total normal de 800 parece suficiente, mas um único worker sobrevivente deixa um défice de 250. Aprova a alteração apenas após testar desempenho funcional, margem em falha e rollback.
Tratar alertas como sinais com atraso
AWS Budgets permite acompanhar custos, utilização e cobertura, mas a notificação depende da chegada dos dados de faturação. Não constitui um teto instantâneo de despesa. Cost Anomaly Detection também depende desses dados; um monitor acabado de criar ou consumo muito recente não oferece prova imediata de ausência de anomalia. Para uma tarefa com risco de crescimento rápido, combina alertas com limites operacionais acordados, acompanhamento técnico e um owner de resposta. Budget actions exigem configuração própria e podem ter aprovação manual. Impedir novas criações não para automaticamente recursos já existentes. A partir da conta de gestão, uma ação pode aplicar SCP a outra conta, mas não selecionar diretamente instâncias EC2 ou RDS dessa outra conta para parar. O PM deve testar âmbito, permissões e consequência operacional antes de automatizar uma reação que possa afetar o fecho.
Seguir o caminho do tráfego e comprovar a poupança
Uma redução de custo de instâncias pode esconder mais transferência de dados. Para NAT, identifica horas de disponibilidade, GB processados e tráfego entre zonas. Centralizar tudo numa zona pode reduzir um componente fixo e aumentar outro componente ou a dependência de falha. Para consumidores numa VPC que acedem a S3 na mesma região, avalia gateway endpoint, tabelas associadas e políticas. Este tipo de endpoint não tem encargo adicional próprio; isso não elimina custos do serviço S3. Criá-lo sem associar a tabela da aplicação pode deixar o tráfego no NAT. No caso fictício, compara o mesmo ciclo funcional antes e depois, com volume normalizado, latência e erros. Regista custo por unidade de trabalho concluída, custo total e resíduos após descomissionamento. Retirar um recurso exige owner e evidência de desuso, e uma recomendação só passa a poupança realizada após observar o resultado.
worker_capacity_per_min = 400
demand_per_min = 650
proposed_workers = 2
normal_capacity = proposed_workers * worker_capacity_per_min # 800
failure_capacity = (proposed_workers - 1) * worker_capacity_per_min # 400
failure_shortfall = max(0, demand_per_min - failure_capacity) # 250
# Fictional measured linear capacities; not AWS quotas or a load test.Uma equipa fictícia propõe reduzir workers antes do fecho mensal com base em CPU diurna. APS demonstra o défice de capacidade após falha e pede um ensaio representativo antes da mudança. A poupança prevista mantém-se como hipótese até medir o ciclo completo.
Armadilhas comuns
Excluir custos sem tag; inventar histórico no backfill; tratar alertas como teto; reduzir por CPU sem memória; esquecer tráfego e capacidade em falha.
Tópicos relacionados: Compromissos de consumo e capacidade
Uma otimização é aceite com custo comparável, evidência funcional e capacidade suficiente nas condições acordadas.
Referência: EC2 metrics in Compute Optimizer · SAP-C02