Questão 3 — Simulado AWS Certified AI Practitioner (AIP-C01) – Questões Atualizadas
Uma empresa está usando Amazon Bedrock e Anthropic Claude 3 Haiku para desenvolver um assistente de IA. O assistente de IA normalmente processa 10.000 solicitações por hora, mas enfrenta picos de até 30.000 solicitações por hora durante períodos de pico de uso. O assistente de IA deve responder dentro de 2 segundos enquanto opera em várias regiões da AWS. A empresa observa que durante períodos de pico de uso, o assistente de IA enfrenta gargalos de transferência que causam aumento de latência e tempos limite de solicitação ocasionais. A empresa deve resolver os problemas de desempenho. Qual solução atenderá a esse requisito?
- A. Compre taxa de transferência provisionada e unidades de modelo (MUs) suficientes em uma única região. Configure o aplicativo para repetir solicitações com falha com espera exponencial.
- B. Implemente o lote de tokens para reduzir a sobrecarga da API. Use perfis de inferência entre regiões para distribuir automaticamente o tráfego entre as regiões disponíveis.
- C. Configure funções de escalonamento automático do AWS Lambda em cada região. Implemente a distribuição de solicitações round-robin do lado do cliente. Compre uma unidade modelo (MU) de taxa de transferência provisionada como backup.
- D. Implemente a inferência em lote para todas as solicitações usando buckets do Amazon S3 em várias regiões. Use o Amazon SQS para configurar um processo de recuperação assíncrona.
Resposta correta:
B
Explicação
Explicação: A opção B é a solução correta porque aborda diretamente os gargalos de taxa de transferência e os requisitos de latência usando recursos nativos de otimização de desempenho do Amazon Bedrock projetados para cargas de trabalho de IA generativas de alto volume e em tempo real. O Amazon Bedrock oferece suporte a perfis de inferência entre regiões, que permitem que os aplicativos roteem de forma transparente solicitações de inferência em várias regiões da AWS. Durante períodos de pico de uso, o tráfego é distribuído automaticamente para regiões com capacidade disponível, reduzindo a limitação, o enfileiramento de solicitações e os riscos de tempo limite. Essa abordagem se alinha às orientações da AWS para a criação de aplicativos GenAI altamente disponíveis e de baixa latência, que devem ser dimensionados de forma elástica entre fronteiras geográficas. O lote de tokens melhora ainda mais a eficiência, combinando diversas solicitações de inferência em uma única invocação de modelo, quando aplicável. A documentação do AWS Generative AI destaca o lote como uma técnica de otimização chave para reduzir a sobrecarga por solicitação, melhorar o rendimento e utilizar melhor a capacidade do modelo. Isto é especialmente eficaz para modelos leves e de baixa latência, como o Claude 3 Haiku, que são projetados para respostas rápidas e altos volumes de solicitações. A opção A não atende ao requisito porque a compra de taxa de transferência provisionada em uma única região cria um gargalo regional e não aborda a disponibilidade multirregional ou picos de tráfego além da capacidade reservada. As novas tentativas aumentam a carga e a latência em vez de resolver a causa raiz. A opção C melhora o dimensionamento da camada de aplicação, mas não resolve os limites de rendimento do lado do modelo. O roteamento round-robin do lado do cliente não tem conhecimento da capacidade do modelo em tempo real e ainda pode enviar tráfego para regiões saturadas. A opção D é inadequada porque a inferência em lote com recuperação assíncrona foi projetada para cargas de trabalho off-line ou não interativas. Ele não pode atender a um requisito estrito de tempo de resposta de 2 segundos para um assistente de IA interativo. Portanto, a Opção B fornece a solução mais eficaz e alinhada à AWS para obter baixa latência, escalabilidade global e alto rendimento durante períodos de pico de uso.
Quer todas as 119 questões por R$ 198,00?