Conceito e mecanismo
Uma carga incremental precisa de uma fronteira que represente trabalho consolidado. Com um marcador fiável que avança em cada alteração, captura o valor anterior e um novo limite e extrai o intervalo aberto à esquerda e fechado à direita. Atualizar o marcador antes de concluir a escrita pode saltar dados após falha. Repetir o intervalo também não é suficiente quando o destino faz append: as linhas já escritas podem duplicar. Usa staging, upsert ou reconciliação adequados à chave e à regra de negócio. Eliminações físicas exigem outro mecanismo, como Change Tracking ou comparação controlada; uma linha que desapareceu não fornece LastModified para a consulta incremental.
Aplicação guiada
O integration runtime determina onde a cópia pode executar e que rede consegue alcançar. Self-hosted IR suporta origens privadas acessíveis pelo host; mapping data flows executam em compute Azure gerido. Para janelas contíguas com estado e dependências, avalia tumbling window triggers. Antes de MERGE, resolve múltiplas linhas que correspondem ao mesmo destino. A deteção de duplicados mudou entre Databricks Runtime15.4 LTS e16.0+, pelo que cada caso deve declarar condições e versão. Nunca aplica eliminações por ausência a um delta como se fosse um snapshot completo. Schema drift aceita mudanças estruturais, mas unidades, tipos e montantes precisam de validação. Regista rejeições e reconcilia-as antes de publicar resultados.
Foram escritas240 de300 linhas. Mantém o marcador anterior, repete o intervalo com upsert e prova as300 linhas antes da publicação.
Armadilhas comuns
Marcador adiantado; append na recuperação; delta tratado como snapshot; sucesso com rejeições tratado como completude.
Tópicos relacionados: Armazenamento, distribuição e exploração · Streams, tempo e efeitos externos · Acesso ao lake e gestão de segredos
Uma carga termina quando o destino e o controlo concordam com o contrato de dados.
Referência: Incremental loading and change tracking · DP-203 objectives 2024-10-24; retired 2025-03-31