← AWS Machine Learning Engineer: preparar e operar modelos
01 / 8 · 40 MIN

Ingestão, armazenamento e qualidade

Prepara dados utilizáveis e deteta falhas antes de alimentar treino ou pesquisa.

Conceito e mecanismo

Uma pipeline de ML começa com contratos sobre os dados: origem, esquema, significado, momento do evento, atraso esperado e tratamento de registos inválidos. Escolhe formatos e armazenamento segundo acesso e transformação. Parquet é adequado a leituras analíticas por colunas; JSON pode preservar estruturas variáveis que ainda precisam de validação. Streaming reduz o atraso entre chegada e processamento, mas exige lidar com duplicados, eventos atrasados e consumidores que não acompanham a entrada. Um identificador estável permite reconhecer repetições. Não confundas confirmação de receção com processamento concluído. Regista contagens, rejeições e atrasos para reconciliar o que entrou com o que foi disponibilizado. Vetores acrescentam representação para pesquisa semântica, mantendo requisitos sobre versão, dimensão, metadados e acesso aos documentos associados.

Aplicação guiada

Num exercício fictício, a origem altera o montante de número para texto com separador decimal diferente. O job termina com sucesso técnico, mas produz muitos valores vazios. Uma regra de completude ou intervalo ajuda a interromper promoção desses dados e a encaminhar registos para quarentena. AWS Glue Data Quality permite regras DQDL em catálogo ou ETL; a equipa deve definir reação a falhas, responsáveis e reprocessamento. Um score agregado não substitui critérios para campos críticos. Para documentos destinados a RAG, preserva identificador, versão, permissões e condições junto dos chunks. Se muda o modelo de embeddings, confirma compatibilidade do índice e reindexação necessária. A entrega a APS inclui métricas de frescura e contagem, procedimento de recuperação e forma de distinguir atraso de perda de dados.

NA PRÁTICA

Um job verde pode produzir um dataset inadequado para treino.

Armadilhas comuns

Sucesso técnico como qualidade; duplicados sem chave; score médio sem campos críticos; embeddings de versões incompatíveis.

Tópicos relacionados: Features, partições e fuga de informação · Treino, afinação e experiências reproduzíveis · Modelos fundacionais e qualidade de RAG

Leva esta ideia contigo

Valida significado e completude dos dados, e define o que acontece quando falham.

Criar conta

Referência: AWS Glue Data Quality · MLA-C02

AWS é uma marca comercial da Amazon.com, Inc. ou das suas afiliadas. A dr.pt é uma plataforma de preparação independente e não está afiliada, associada, patrocinada, autorizada nem aprovada por AWS. Os conteúdos e as perguntas são originais, não são perguntas oficiais de exame, e concluir os nossos testes não atribui nem garante qualquer certificação. Os nomes são usados apenas para identificar o tema. Todas as outras marcas pertencem aos respetivos titulares.