← Databricks Machine Learning Associate: treino e operação
05 / 7 · 40 MIN

Treino, pipelines e pesquisa de parâmetros

Compara alternativas com custo e validação controlados.

Conceito e mecanismo

Escolhe uma tarefa antes de uma família de modelos. Prever minutos de processamento é regressão; decidir se ultrapassa uma janela é classificação, com um limiar e consequências próprias. Define uma baseline simples para saber se a complexidade acrescenta valor. Em Spark ML, um Estimator aprende através de fit e produz um modelo que funciona como Transformer. Uma Pipeline ordena fases de preparação e aprendizagem; o PipelineModel aplica as fases ajustadas. Ajustar novamente na avaliação compromete a comparação. Mantém o contrato das colunas entre treino e inferência. Distribuir uma pesquisa de configurações não significa que cada algoritmo se torne distribuído por dentro.

Aplicação guiada

Grid search percorre combinações definidas; random search amostra configurações; métodos adaptativos usam resultados anteriores para orientar novas escolhas. No Hyperopt legado, fmin minimiza a função objetivo; retornar uma métrica que deve aumentar exige converter a direção. max_evals limita trials, não folds. SparkTrials paraleliza modelos de uma máquina, enquanto uma função que já usa treino distribuído MLlib precisa de outra estratégia, como Trials no contexto documentado. O blueprint mantém estes conceitos, mas para projetos novos confirma opções suportadas, como Optuna ou Ray Tune. Se há quatro profundidades e três regularizações, são doze configurações. Com quatro folds são 48 ajustes de validação cruzada; refit final acrescenta um, totalizando 49.

NA PRÁTICA

Mais paralelismo pode reduzir tempo decorrido, mas não o número lógico de fits.

Armadilhas comuns

Maximizar uma loss; contar trials como folds; confundir paralelismo de trials com treino distribuído.

Tópicos relacionados: Ambiente, AutoML e reprodutibilidade · Features temporais e consistência · MLflow, registo e promoção

Leva esta ideia contigo

Planeia a pesquisa em função da evidência necessária e do orçamento de execução.

Criar conta

Referência: Hyperopt fmin Trials and SparkTrials concepts · 2025-03-01

Databricks é uma marca comercial de Databricks, Inc. A dr.pt é uma plataforma de preparação independente e não está afiliada, associada, patrocinada, autorizada nem aprovada por Databricks. Os conteúdos e as perguntas são originais, não são perguntas oficiais de exame, e concluir os nossos testes não atribui nem garante qualquer certificação. Os nomes são usados apenas para identificar o tema. Todas as outras marcas pertencem aos respetivos titulares.