Conceito e mecanismo
Um endpoint pode responder rapidamente e continuar a produzir previsões inadequadas. Observa três camadas: infraestrutura, qualidade de dados e qualidade do modelo ou aplicação. Latência, erros, utilização e filas ajudam a localizar problemas de serviço. Mudanças na distribuição de entradas indicam drift de dados; não demonstram, por si só, perda de accuracy. Para medir qualidade preditiva, correlaciona previsões com resultados reais, que podem chegar dias depois. Mantém identificadores, timestamps, janela avaliada e cobertura dos rótulos. Sem essa cobertura, uma métrica pode refletir apenas casos fáceis de confirmar. Para RAG e agentes, observa recuperação, suporte factual, falhas de ferramentas, passos incompletos e conclusão da tarefa. A presença de texto na resposta não prova conclusão de uma ação.
Aplicação guiada
Num cenário fictício, o custo por chamada caiu, mas os retries duplicaram e a taxa de conclusão diminuiu. Compara custo por resultado útil, incluindo inferência, embeddings, índice vetorial, armazenamento e capacidade ociosa. Se 240 unidades financiam 800 tarefas concluídas, o custo observado é 0,30 por tarefa, ainda que tenham ocorrido mais chamadas. Mantém a disponibilidade dos serviços explícita: Model Monitor está fechado a novos clientes segundo a documentação consultada. Para novos projetos, avalia pipelines de monitorização suportadas, métricas CloudWatch e soluções de referência adaptadas; não copies limiares de demonstração como política do banco. Clientes existentes podem continuar a usar o serviço. Um alerta deve ter responsável, contexto e ação de diagnóstico; retraining automático sem investigar dados defeituosos pode perpetuar a falha.
Drift de entrada, falha de infraestrutura e perda de qualidade exigem evidência diferente.
Armadilhas comuns
Latência como accuracy; rótulos atrasados ignorados; custo por chamada como custo útil; retraining sem diagnóstico; referência como política.
Tópicos relacionados: Ingestão, armazenamento e qualidade · Features, partições e fuga de informação · Treino, afinação e experiências reproduzíveis
Liga métricas ao resultado e investiga a causa antes de automatizar correções.
Referência: Model Monitor availability change · MLA-C02