Conceito e mecanismo
Escolhe uma tarefa antes de uma família de modelos. Prever minutos de processamento é regressão; decidir se ultrapassa uma janela é classificação, com um limiar e consequências próprias. Define uma baseline simples para saber se a complexidade acrescenta valor. Em Spark ML, um Estimator aprende através de fit e produz um modelo que funciona como Transformer. Uma Pipeline ordena fases de preparação e aprendizagem; o PipelineModel aplica as fases ajustadas. Ajustar novamente na avaliação compromete a comparação. Mantém o contrato das colunas entre treino e inferência. Distribuir uma pesquisa de configurações não significa que cada algoritmo se torne distribuído por dentro.
Aplicação guiada
Grid search percorre combinações definidas; random search amostra configurações; métodos adaptativos usam resultados anteriores para orientar novas escolhas. No Hyperopt legado, fmin minimiza a função objetivo; retornar uma métrica que deve aumentar exige converter a direção. max_evals limita trials, não folds. SparkTrials paraleliza modelos de uma máquina, enquanto uma função que já usa treino distribuído MLlib precisa de outra estratégia, como Trials no contexto documentado. O blueprint mantém estes conceitos, mas para projetos novos confirma opções suportadas, como Optuna ou Ray Tune. Se há quatro profundidades e três regularizações, são doze configurações. Com quatro folds são 48 ajustes de validação cruzada; refit final acrescenta um, totalizando 49.
Mais paralelismo pode reduzir tempo decorrido, mas não o número lógico de fits.
Armadilhas comuns
Maximizar uma loss; contar trials como folds; confundir paralelismo de trials com treino distribuído.
Tópicos relacionados: Ambiente, AutoML e reprodutibilidade · Features temporais e consistência · MLflow, registo e promoção
Planeia a pesquisa em função da evidência necessária e do orçamento de execução.
Referência: Hyperopt fmin Trials and SparkTrials concepts · 2025-03-01