Conceito e mecanismo
A métrica deve responder à decisão de utilização. Num sistema que sinaliza jobs para revisão, precisão mede quantos alertas correspondem realmente ao evento e recall mede quantos eventos foram encontrados. Com 18 verdadeiros positivos, seis falsos positivos e 12 falsos negativos, precisão é 18/24 = 75% e recall é 18/30 = 60%. F1 combina precisão e recall de forma harmónica; não é percentagem global de acertos. Uma accuracy elevada pode esconder uma classe rara nunca identificada. Analisa limiares, volume de revisão e consequências dos erros. ROC AUC descreve ordenação através de limiares, mas não define por si só o limiar operacional nem demonstra probabilidades calibradas.
Aplicação guiada
Para probabilidades de classificação, log loss penaliza previsões confiantes erradas. Para regressão de duração, MAE tem a unidade do alvo e RMSE dá mais peso a erros grandes. Com erros absolutos de 2, 4 e 9 minutos, MAE é cinco minutos. Compara também com uma baseline e com grupos operacionais relevantes; R² pode ser negativo quando o modelo é pior do que prever a média de referência. Se treinaste sobre log1p do alvo, interpreta resultados na escala original com a transformação inversa apropriada. Erro pequeno no treino e grande na validação sugere investigar sobreajustamento ou mudança dos dados; não prova uma causa única.
Escolher a maior accuracy pode aumentar o número de eventos críticos não detetados.
Armadilhas comuns
Média global como SLA; probabilidade como classe; erro logarítmico apresentado em minutos.
Tópicos relacionados: Ambiente, AutoML e reprodutibilidade · Features temporais e consistência · MLflow, registo e promoção
Mostra o denominador, a escala e o custo dos erros antes de promover.
Referência: Model evaluation metrics · 2025-03-01