← Databricks Machine Learning Associate: treino e operação
04 / 7 · 40 MIN

Dados, preparação e validação

Prepara features sem usar informação do conjunto reservado.

Conceito e mecanismo

Antes de escolher um algoritmo, inspeciona tipos, contagens, valores em falta e distribuição. summary em PySpark inclui estatísticas e percentis aproximados; não é um teste de validade do negócio. Um valor extremo pode ser erro ou um evento operacional importante. Com primeiro quartil 20 e terceiro 36, o intervalo interquartil é 16; a regra exploratória superior Q3 + 1,5 × IQR dá 60. Investiga valores acima desse limite antes de os eliminar. Uma média é sensível a valores extremos; a mediana pode ser uma alternativa para uma variável numérica assimétrica. Para categorias, a moda ou uma categoria explícita de ausência pode fazer mais sentido, dependendo do contrato e do modelo.

Aplicação guiada

Separa treino e avaliação antes de aprender estatísticas de preparação. Ajusta imputação, escalas e seleção de features apenas nos dados de treino de cada fold; aplica a transformação já ajustada à validação. Uma pipeline ajuda a manter esta disciplina. One-hot encoding evita impor uma ordem numérica arbitrária a nomes de aplicações. Define o tratamento de categorias novas: o comportamento predefinido do OneHotEncoder é erro; ignore produz zeros para a feature desconhecida, sem aprender automaticamente uma categoria. Num modelo para dias futuros, usa uma validação que preserve a direção temporal. Se várias linhas pertencem ao mesmo incidente, considera também a separação por grupo.

NA PRÁTICA

Uma mediana calculada antes do split já usou o conjunto reservado.

Armadilhas comuns

Eliminar todos os extremos; fit na validação; códigos de categorias tratados como grandezas.

Tópicos relacionados: Ambiente, AutoML e reprodutibilidade · Features temporais e consistência · MLflow, registo e promoção

Leva esta ideia contigo

Aprende transformações no treino e preserva a independência da avaliação.

Criar conta

Referência: Prevent inconsistent preprocessing and data leakage · 2025-03-01

Databricks é uma marca comercial de Databricks, Inc. A dr.pt é uma plataforma de preparação independente e não está afiliada, associada, patrocinada, autorizada nem aprovada por Databricks. Os conteúdos e as perguntas são originais, não são perguntas oficiais de exame, e concluir os nossos testes não atribui nem garante qualquer certificação. Os nomes são usados apenas para identificar o tema. Todas as outras marcas pertencem aos respetivos titulares.