Conceito e mecanismo
Lakeflow Jobs organiza tarefas num grafo de dependências. Uma tarefa pode executar notebook, SQL ou pipeline; condições permitem ramificar, e for each permite repetir trabalho parametrizado. Desenha dependências a partir dos dados e critérios de publicação. Duas tarefas agendadas para horas próximas não constituem uma dependência robusta. Um trigger agendado responde ao relógio; file arrival responde à chegada de ficheiros; table update deteta alterações em tabelas. Escolher any ou all para várias tabelas controla o evento de disparo, mas não confirma que os dados pertencem à mesma data de negócio. Acrescenta validação explícita de período, completude e qualidade antes de disponibilizar resultados.
Aplicação guiada
Num incidente fictício, a ingestão conclui, a transformação grava parte dos resultados e falha, e a publicação fica bloqueada. Investiga a primeira falha e os efeitos persistidos antes de reparar. Repair pode executar novamente tarefas sem sucesso e dependentes, usando a configuração atual, mas reinicia a tarefa e não torna um append idempotente. Define chaves, partições ou estratégia de merge adequadas para recuperar sem duplicar. Confirma que uma alteração de código entre a primeira execução e a reparação é compatível com a entrada já produzida. Notificações devem indicar job, execução, tarefa, impacto, responsável e próximo passo. A entrega a APS inclui critérios para parar retries e escalar, preservando evidência para análise posterior.
Reparar um job não apaga os efeitos da tentativa anterior.
Armadilhas comuns
Agendamento como dependência; all tables como data alinhada; retry como idempotência.
Tópicos relacionados: Plataforma, compute e contratos de dados · Ingestão incremental, estado e esquema · Transformação, granularidade e qualidade
Liga publicação a critérios de dados e reconcilia efeitos antes de repetir.
Referência: Lakeflow Jobs orchestration · 2026-05-04