← AWS Machine Learning Engineer: preparar e operar modelos
05 / 8 · 40 MIN

Inferência e mudança controlada

Escolhe o modo de serviço e limita exposição ao promover um modelo.

Conceito e mecanismo

A estratégia de inferência depende do prazo por pedido, tamanho dos dados, padrão de procura e custo de capacidade ociosa. Um endpoint em tempo real serve interação com baixa latência; serverless pode adequar-se a procura intermitente que tolera cold starts; inferência assíncrona coloca pedidos em fila e trata operações demoradas. Batch serve conjuntos sem necessidade de resposta interativa. Confirma características e limites suportados antes de escolher, incluindo GPU, rede, payload e observabilidade. Dimensiona com testes representativos, não apenas com CPU média. Fila, latência de cauda, memória e concorrência podem revelar o recurso limitante. Autoscaling precisa de métricas, limites e tempo para reagir; não substitui capacidade inicial adequada a picos previstos.

Aplicação guiada

Num exercício de scoring, a equipa quer observar um novo modelo sem devolver as suas previsões aos utilizadores. Uma shadow variant recebe cópias de pedidos; a variante de produção continua a responder. Esta abordagem difere de A/B, em que variantes de produção servem diferentes pedidos. Shadow tests têm exclusões, incluindo endpoints serverless e assíncronos, que devem ser confirmadas. Deployment guardrails são outra capacidade: permitem mudanças blue/green ou rolling com observação e rollback configurados, aplicáveis a endpoints em tempo real e assíncronos. Um alarme de latência não deteta necessariamente pior qualidade preditiva. Define critérios operacionais e funcionais, janela de observação e caminho de recuperação. Reverter o endpoint não desfaz automaticamente decisões já consumidas por sistemas posteriores; o plano precisa de considerar esse efeito.

NA PRÁTICA

Uma resposta shadow observada não é a resposta devolvida ao utilizador.

Armadilhas comuns

Shadow confundido com A/B; guardrails de deployment confundidos com filtros de conteúdo; rollback sem efeitos posteriores; autoscaling instantâneo presumido.

Tópicos relacionados: Ingestão, armazenamento e qualidade · Features, partições e fuga de informação · Treino, afinação e experiências reproduzíveis

Leva esta ideia contigo

Combina modo de inferência, observação representativa e recuperação do resultado completo.

Criar conta

Referência: SageMaker inference options · MLA-C02

AWS é uma marca comercial da Amazon.com, Inc. ou das suas afiliadas. A dr.pt é uma plataforma de preparação independente e não está afiliada, associada, patrocinada, autorizada nem aprovada por AWS. Os conteúdos e as perguntas são originais, não são perguntas oficiais de exame, e concluir os nossos testes não atribui nem garante qualquer certificação. Os nomes são usados apenas para identificar o tema. Todas as outras marcas pertencem aos respetivos titulares.