Conceito e mecanismo
Antes de escolher um algoritmo, inspeciona tipos, contagens, valores em falta e distribuição. summary em PySpark inclui estatísticas e percentis aproximados; não é um teste de validade do negócio. Um valor extremo pode ser erro ou um evento operacional importante. Com primeiro quartil 20 e terceiro 36, o intervalo interquartil é 16; a regra exploratória superior Q3 + 1,5 × IQR dá 60. Investiga valores acima desse limite antes de os eliminar. Uma média é sensível a valores extremos; a mediana pode ser uma alternativa para uma variável numérica assimétrica. Para categorias, a moda ou uma categoria explícita de ausência pode fazer mais sentido, dependendo do contrato e do modelo.
Aplicação guiada
Separa treino e avaliação antes de aprender estatísticas de preparação. Ajusta imputação, escalas e seleção de features apenas nos dados de treino de cada fold; aplica a transformação já ajustada à validação. Uma pipeline ajuda a manter esta disciplina. One-hot encoding evita impor uma ordem numérica arbitrária a nomes de aplicações. Define o tratamento de categorias novas: o comportamento predefinido do OneHotEncoder é erro; ignore produz zeros para a feature desconhecida, sem aprender automaticamente uma categoria. Num modelo para dias futuros, usa uma validação que preserve a direção temporal. Se várias linhas pertencem ao mesmo incidente, considera também a separação por grupo.
Uma mediana calculada antes do split já usou o conjunto reservado.
Armadilhas comuns
Eliminar todos os extremos; fit na validação; códigos de categorias tratados como grandezas.
Tópicos relacionados: Ambiente, AutoML e reprodutibilidade · Features temporais e consistência · MLflow, registo e promoção
Aprende transformações no treino e preserva a independência da avaliação.
Referência: Prevent inconsistent preprocessing and data leakage · 2025-03-01