Databricks Machine Learning Associate: treino e operação
Sete aulas, 40 perguntas e sete casos sobre AutoML, features, MLflow, preparação, treino, métricas e serving. Preparação independente em PT-PT e inglês.
Objetivos e percurso
Preparação independente alinhada com os quatro domínios do guia de Machine Learning Associate ainda ligado pela página oficial em outubro de 2026. Aprende a rever trials AutoML, preservar a semântica temporal de features, registar experiências MLflow e distinguir promoção de modelos de deployment efetivo. As aulas ligam preparação de dados, pipelines, pesquisa de parâmetros e métricas à utilização operacional. Sete casos fictícios incluem pressão para promover uma métrica inválida, inputs antigos que substituem lookups, orçamento de treino, capacidade de revisão e identidade removida de um endpoint. Inclui 28 fontes primárias, progresso e avaliação interna de 28 decisões em 60 minutos. Explica diferenças entre termos do blueprint e funcionalidades dos runtimes atuais; esta cobertura inicial não é um mock completo nem substitui prática supervisionada.
Para quem: Profissionais de dados, Python, APS e projetos que preparam e operam modelos de machine learning.
Pré-requisitos: Python, SQL e noções de estatística e ML. O exame não impõe pré-requisitos; recomenda experiência prática.
340 minutos de estudo estimados
- Inspeciona experiências e valida dependências antes de aceitar uma métrica.
- Evita fuga temporal e diferenças silenciosas entre treino e inferência.
- Liga resultados a versões e distingue registo de deployment.
- Prepara features sem usar informação do conjunto reservado.
- Compara alternativas com custo e validação controlados.
- Interpreta erros na unidade e no contexto da decisão operacional.
- Escolhe o modo de consumo e controla identidade, versão e tráfego.
Módulos
- Ambiente, AutoML e reprodutibilidade
- Features temporais e consistência
- MLflow, registo e promoção
- Dados, preparação e validação
- Treino, pipelines e pesquisa de parâmetros
- Métricas, decisão e generalização
- Inferência, serving e recuperação
Continua a aprender
- Python
- SQL
- Databricks Certified Data Engineer Associate
- AWS Certified Machine Learning Engineer - Associate
- AWS Certified AI Practitioner
Referências e versão
2025-03-01
- Databricks Certified Machine Learning Associate · 2026-10-01
- Machine Learning Associate exam guide effective 1 March 2025 · 2026-10-01
- AutoML trial notebooks and runtime support · 2026-10-01
- Hyperparameter tuning and Hyperopt runtime changes · 2026-10-01
- Hyperopt fmin Trials and SparkTrials concepts · 2026-10-01
- MLflow 3 installation and migration · 2026-10-01
- Model lifecycle in Unity Catalog · 2026-10-01
- Feature engineering and serving overview · 2026-10-01
- Feature tables in Unity Catalog · 2026-10-01
- Point-in-time feature lookups · 2026-10-01
- Train and score with feature metadata · 2026-10-01
- Track experiments and training runs · 2026-10-01
- Deploy models using Model Serving · 2026-10-01
- Create custom model serving endpoints and identity · 2026-10-01
- Traffic routing across served models · 2026-10-01
- Delta Lake streaming reads and writes · 2026-10-01
- Lakeflow Spark Declarative Pipelines · 2026-10-01
- Prevent inconsistent preprocessing and data leakage · 2026-10-01
- Imputation of missing values · 2026-10-01
- Cross-validation and time series splits · 2026-10-01
- OneHotEncoder unknown categories · 2026-10-01
- Precision and recall interpretation · 2026-10-01
- Mean absolute error · 2026-10-01
- Model evaluation metrics · 2026-10-01
- GridSearchCV folds and refit · 2026-10-01
- Transforming regression targets · 2026-10-01
- Spark ML Estimators Transformers and Pipelines · 2026-10-01
- PySpark DataFrame summary statistics · 2026-10-01
O que vais explorar
0 / 7Ambiente, AutoML e reprodutibilidade
Inspeciona experiências e valida dependências antes de aceitar uma métrica.
Features temporais e consistência
Evita fuga temporal e diferenças silenciosas entre treino e inferência.
MLflow, registo e promoção
Liga resultados a versões e distingue registo de deployment.
Dados, preparação e validação
Prepara features sem usar informação do conjunto reservado.
Treino, pipelines e pesquisa de parâmetros
Compara alternativas com custo e validação controlados.
Métricas, decisão e generalização
Interpreta erros na unidade e no contexto da decisão operacional.
Inferência, serving e recuperação
Escolhe o modo de consumo e controla identidade, versão e tráfego.