Conceito e mecanismo
Uma pipeline de ML começa com contratos sobre os dados: origem, esquema, significado, momento do evento, atraso esperado e tratamento de registos inválidos. Escolhe formatos e armazenamento segundo acesso e transformação. Parquet é adequado a leituras analíticas por colunas; JSON pode preservar estruturas variáveis que ainda precisam de validação. Streaming reduz o atraso entre chegada e processamento, mas exige lidar com duplicados, eventos atrasados e consumidores que não acompanham a entrada. Um identificador estável permite reconhecer repetições. Não confundas confirmação de receção com processamento concluído. Regista contagens, rejeições e atrasos para reconciliar o que entrou com o que foi disponibilizado. Vetores acrescentam representação para pesquisa semântica, mantendo requisitos sobre versão, dimensão, metadados e acesso aos documentos associados.
Aplicação guiada
Num exercício fictício, a origem altera o montante de número para texto com separador decimal diferente. O job termina com sucesso técnico, mas produz muitos valores vazios. Uma regra de completude ou intervalo ajuda a interromper promoção desses dados e a encaminhar registos para quarentena. AWS Glue Data Quality permite regras DQDL em catálogo ou ETL; a equipa deve definir reação a falhas, responsáveis e reprocessamento. Um score agregado não substitui critérios para campos críticos. Para documentos destinados a RAG, preserva identificador, versão, permissões e condições junto dos chunks. Se muda o modelo de embeddings, confirma compatibilidade do índice e reindexação necessária. A entrega a APS inclui métricas de frescura e contagem, procedimento de recuperação e forma de distinguir atraso de perda de dados.
Um job verde pode produzir um dataset inadequado para treino.
Armadilhas comuns
Sucesso técnico como qualidade; duplicados sem chave; score médio sem campos críticos; embeddings de versões incompatíveis.
Tópicos relacionados: Features, partições e fuga de informação · Treino, afinação e experiências reproduzíveis · Modelos fundacionais e qualidade de RAG
Valida significado e completude dos dados, e define o que acontece quando falham.
Referência: AWS Glue Data Quality · MLA-C02