← AWS Machine Learning Engineer: preparar e operar modelos
04 / 8 · 40 MIN

Modelos fundacionais e qualidade de RAG

Escolhe personalização e mede a cadeia de recuperação e geração.

Conceito e mecanismo

A seleção de um modelo fundacional combina capacidades, qualidade na tarefa, latência, custo e restrições. Prompt engineering altera instruções e contexto; fine-tuning altera parâmetros com exemplos; RAG fornece informação recuperada; distillation transfere comportamento de um professor para um estudante. Estes mecanismos podem ser combinados, mas cada um traz dados, manutenção e avaliação próprios. Para informação operacional que muda, verifica ingestão e recuperação antes de assumir que novo treino resolve a falha. Versiona prompts, modelo, configuração de retrieval e embeddings. Um índice construído com uma representação incompatível com a consulta pode degradar a pesquisa. Reranking reorganiza candidatos recuperados; não recupera necessariamente um documento que nunca entrou no conjunto candidato. Mede essa etapa separadamente quando localizas falhas.

Aplicação guiada

Num caso fictício, a pesquisa encontra o procedimento certo em 96 de 120 pedidos com documento relevante conhecido. A cobertura observada é 80%; ainda é necessário avaliar se o gerador usa corretamente esse conteúdo. Um resumo pode ter boa sobreposição com uma referência e omitir uma restrição crítica. Combina critérios factuais, completude, comportamento perante evidência insuficiente e avaliação humana. Um LLM avaliador precisa de rubrica e controlo de consistência, não é uma autoridade infalível. Inclui documentos sem resposta e tentativas de instrução maliciosa. Se o sistema não encontra evidência, deve seguir um caminho definido de esclarecimento ou encaminhamento. A avaliação do produto inclui conclusão da tarefa, custo por resultado útil e tratamento de falhas, além da métrica isolada do modelo.

NA PRÁTICA

80% de recuperação relevante não equivale a 80% de tarefas concluídas corretamente.

Armadilhas comuns

Reranking como ingestão; benchmark como aceitação; índice sem versão; juiz automático sem calibração.

Tópicos relacionados: Ingestão, armazenamento e qualidade · Features, partições e fuga de informação · Treino, afinação e experiências reproduzíveis

Leva esta ideia contigo

Mede recuperação, geração e resultado operacional como partes distintas.

Criar conta

Referência: Amazon Bedrock evaluations · MLA-C02

AWS é uma marca comercial da Amazon.com, Inc. ou das suas afiliadas. A dr.pt é uma plataforma de preparação independente e não está afiliada, associada, patrocinada, autorizada nem aprovada por AWS. Os conteúdos e as perguntas são originais, não são perguntas oficiais de exame, e concluir os nossos testes não atribui nem garante qualquer certificação. Os nomes são usados apenas para identificar o tema. Todas as outras marcas pertencem aos respetivos titulares.