← Databricks Data Engineer Associate: pipelines e operação
04 / 7 · 40 MIN

Jobs, dependências e recuperação

Orquestra execução e prepara retries que respeitam efeitos já produzidos.

Conceito e mecanismo

Lakeflow Jobs organiza tarefas num grafo de dependências. Uma tarefa pode executar notebook, SQL ou pipeline; condições permitem ramificar, e for each permite repetir trabalho parametrizado. Desenha dependências a partir dos dados e critérios de publicação. Duas tarefas agendadas para horas próximas não constituem uma dependência robusta. Um trigger agendado responde ao relógio; file arrival responde à chegada de ficheiros; table update deteta alterações em tabelas. Escolher any ou all para várias tabelas controla o evento de disparo, mas não confirma que os dados pertencem à mesma data de negócio. Acrescenta validação explícita de período, completude e qualidade antes de disponibilizar resultados.

Aplicação guiada

Num incidente fictício, a ingestão conclui, a transformação grava parte dos resultados e falha, e a publicação fica bloqueada. Investiga a primeira falha e os efeitos persistidos antes de reparar. Repair pode executar novamente tarefas sem sucesso e dependentes, usando a configuração atual, mas reinicia a tarefa e não torna um append idempotente. Define chaves, partições ou estratégia de merge adequadas para recuperar sem duplicar. Confirma que uma alteração de código entre a primeira execução e a reparação é compatível com a entrada já produzida. Notificações devem indicar job, execução, tarefa, impacto, responsável e próximo passo. A entrega a APS inclui critérios para parar retries e escalar, preservando evidência para análise posterior.

NA PRÁTICA

Reparar um job não apaga os efeitos da tentativa anterior.

Armadilhas comuns

Agendamento como dependência; all tables como data alinhada; retry como idempotência.

Tópicos relacionados: Plataforma, compute e contratos de dados · Ingestão incremental, estado e esquema · Transformação, granularidade e qualidade

Leva esta ideia contigo

Liga publicação a critérios de dados e reconcilia efeitos antes de repetir.

Criar conta

Referência: Lakeflow Jobs orchestration · 2026-05-04

Databricks é uma marca comercial de Databricks, Inc. A dr.pt é uma plataforma de preparação independente e não está afiliada, associada, patrocinada, autorizada nem aprovada por Databricks. Os conteúdos e as perguntas são originais, não são perguntas oficiais de exame, e concluir os nossos testes não atribui nem garante qualquer certificação. Os nomes são usados apenas para identificar o tema. Todas as outras marcas pertencem aos respetivos titulares.