Conceito e mecanismo
A estratégia de inferência depende do prazo por pedido, tamanho dos dados, padrão de procura e custo de capacidade ociosa. Um endpoint em tempo real serve interação com baixa latência; serverless pode adequar-se a procura intermitente que tolera cold starts; inferência assíncrona coloca pedidos em fila e trata operações demoradas. Batch serve conjuntos sem necessidade de resposta interativa. Confirma características e limites suportados antes de escolher, incluindo GPU, rede, payload e observabilidade. Dimensiona com testes representativos, não apenas com CPU média. Fila, latência de cauda, memória e concorrência podem revelar o recurso limitante. Autoscaling precisa de métricas, limites e tempo para reagir; não substitui capacidade inicial adequada a picos previstos.
Aplicação guiada
Num exercício de scoring, a equipa quer observar um novo modelo sem devolver as suas previsões aos utilizadores. Uma shadow variant recebe cópias de pedidos; a variante de produção continua a responder. Esta abordagem difere de A/B, em que variantes de produção servem diferentes pedidos. Shadow tests têm exclusões, incluindo endpoints serverless e assíncronos, que devem ser confirmadas. Deployment guardrails são outra capacidade: permitem mudanças blue/green ou rolling com observação e rollback configurados, aplicáveis a endpoints em tempo real e assíncronos. Um alarme de latência não deteta necessariamente pior qualidade preditiva. Define critérios operacionais e funcionais, janela de observação e caminho de recuperação. Reverter o endpoint não desfaz automaticamente decisões já consumidas por sistemas posteriores; o plano precisa de considerar esse efeito.
Uma resposta shadow observada não é a resposta devolvida ao utilizador.
Armadilhas comuns
Shadow confundido com A/B; guardrails de deployment confundidos com filtros de conteúdo; rollback sem efeitos posteriores; autoscaling instantâneo presumido.
Tópicos relacionados: Ingestão, armazenamento e qualidade · Features, partições e fuga de informação · Treino, afinação e experiências reproduzíveis
Combina modo de inferência, observação representativa e recuperação do resultado completo.
Referência: SageMaker inference options · MLA-C02