Databricks Data Engineer Associate: pipelines e operação
Sete aulas, 40 perguntas e sete casos sobre ingestão, SQL/PySpark, Lakeflow Jobs, CI/CD, diagnóstico e Unity Catalog. Preparação independente em PT-PT e inglês.
Objetivos e percurso
Preparação independente alinhada com os sete domínios do guia em vigor desde 4 maio 2026. Aprende a escolher compute, ingerir dados com estado e contratos claros, transformar com SQL e PySpark, coordenar jobs e recuperar falhas sem duplicar escritas. O percurso aborda promoção de versões com Git e bundles, diagnóstico de desempenho e custo, privilégios e políticas em Unity Catalog. Casos fictícios de dados de fundos e reconciliação ligam engenharia a entrega de projetos e autonomia de APS. Inclui 34 fontes primárias, explicações por alternativa, progresso e avaliação interna de 28 decisões em 60 minutos. Esta primeira cobertura não é um mock integral nem substitui prática num ambiente controlado.
Para quem: Profissionais de dados, desenvolvimento, APS e projetos que constroem e operam pipelines Databricks.
Pré-requisitos: Noções de SQL, Python, dados e cloud. O exame não impõe pré-requisitos; experiência prática é recomendada.
340 minutos de estudo estimados
- Relaciona armazenamento, processamento e governação com requisitos operacionais.
- Escolhe ingestão e trata alterações de origem sem perder rastreabilidade.
- Interpreta SQL e DataFrames com atenção a duplicados, nulos e cardinalidade.
- Orquestra execução e prepara retries que respeitam efeitos já produzidos.
- Versiona alterações e separa validação de configuração de evidência funcional.
- Localiza o tempo gasto e avalia otimizações com resultados comparáveis.
- Aplica privilégios e políticas com atenção à herança e ao armazenamento.
Módulos
- Plataforma, compute e contratos de dados
- Ingestão incremental, estado e esquema
- Transformação, granularidade e qualidade
- Jobs, dependências e recuperação
- Git, bundles e promoção entre ambientes
- Diagnóstico, desempenho e custo
- Unity Catalog, acesso e ciclo de vida
Continua a aprender
- SQL
- Python
- Professional Data Engineer
- AWS Certified Machine Learning Engineer - Associate
- Suporte de aplicações em produção
Referências e versão
2026-05-04
- Databricks Certified Data Engineer Associate · 2026-10-01
- Data Engineer Associate exam guide effective 4 May 2026 · 2026-10-01
- Databricks compute · 2026-10-01
- Medallion architecture · 2026-10-01
- Auto Loader ingestion and checkpoints · 2026-10-01
- Auto Loader schema inference and evolution · 2026-10-01
- COPY INTO incremental ingestion · 2026-10-01
- Lakeflow Connect connector concepts · 2026-10-01
- PySpark DataFrames and evaluation · 2026-10-01
- Databricks SQL joins · 2026-10-01
- Explode arrays and maps · 2026-10-01
- SQL set operators · 2026-10-01
- try_cast and invalid input · 2026-10-01
- Count aggregate semantics · 2026-10-01
- Materialized views and refresh · 2026-10-01
- Lakeflow Jobs orchestration · 2026-10-01
- Troubleshoot and repair failed jobs · 2026-10-01
- Job schedules and triggers · 2026-10-01
- Table update triggers · 2026-10-01
- Git folders concepts · 2026-10-01
- Git integration and production guidance · 2026-10-01
- Declarative Automation Bundles lifecycle · 2026-10-01
- Validate deploy and run a bundle · 2026-10-01
- Diagnose performance with Spark UI · 2026-10-01
- Spark skew and spill · 2026-10-01
- Liquid clustering · 2026-10-01
- Predictive optimization · 2026-10-01
- Unity Catalog managed tables · 2026-10-01
- Unity Catalog external tables · 2026-10-01
- Manage Unity Catalog privileges · 2026-10-01
- Unity Catalog privilege reference · 2026-10-01
- Legacy SQL DENY scope · 2026-10-01
- Attribute-based access control · 2026-10-01
- ABAC DENY policies Beta and limits · 2026-10-01
O que vais explorar
0 / 7Plataforma, compute e contratos de dados
Relaciona armazenamento, processamento e governação com requisitos operacionais.
Ingestão incremental, estado e esquema
Escolhe ingestão e trata alterações de origem sem perder rastreabilidade.
Transformação, granularidade e qualidade
Interpreta SQL e DataFrames com atenção a duplicados, nulos e cardinalidade.
Jobs, dependências e recuperação
Orquestra execução e prepara retries que respeitam efeitos já produzidos.
Git, bundles e promoção entre ambientes
Versiona alterações e separa validação de configuração de evidência funcional.
Diagnóstico, desempenho e custo
Localiza o tempo gasto e avalia otimizações com resultados comparáveis.
Unity Catalog, acesso e ciclo de vida
Aplica privilégios e políticas com atenção à herança e ao armazenamento.