Questão 13 — Simulado AWS Certified AI Practitioner (AIP-C01) – Questões Atualizadas
Uma empresa está desenvolvendo um aplicativo de IA generativa (GenAI) que analisa chamadas de atendimento ao cliente em tempo real e gera sugestões de respostas para agentes humanos de atendimento ao cliente. O aplicativo deve processar 500 mil chamadas simultâneas durante horários de pico com menos de 200 ms de latência ponta a ponta para cada sugestão. A empresa usa a arquitetura existente para transcrever fluxos de áudio de chamadas de clientes. O aplicativo não deve exceder um orçamento de computação mensal predefinido e deve manter recursos de escalonamento automático. Qual solução atenderá a esses requisitos?
- A. Implante um modelo de raciocínio amplo e complexo no Amazon Bedrock. Compre a taxa de transferência provisionada e otimize para processamento em lote.
- B. Implemente um modelo otimizado em tempo real e de baixa latência no Amazon Bedrock. Compre taxa de transferência provisionada e configure políticas de escalabilidade automática.
- C. Implante um modelo de linguagem grande (LLM) em um endpoint em tempo real do Amazon SageMaker que usa instâncias de GPU dedicadas.
- D. Implante um modelo de linguagem de tamanho médio em um endpoint sem servidor do Amazon SageMaker otimizado para processamento em lote.
Resposta correta:
B
Explicação
Explicação: A opção B é a solução correta porque está alinhada com as diretrizes da AWS para a criação de aplicativos GenAI de alto rendimento e latência ultrabaixa, mantendo custos previsíveis e escalonamento automático. O Amazon Bedrock fornece acesso a modelos básicos otimizados especificamente para casos de uso de inferência em tempo real, incluindo cargas de trabalho de conversação e estilo recomendação que exigem respostas em milissegundos. Os modelos de baixa latência no Amazon Bedrock são projetados para lidar com taxas de solicitação muito altas com sobrecarga mínima por solicitação. A compra de taxa de transferência provisionada garante que seja reservada capacidade suficiente do modelo para lidar com picos de carga, eliminando inicializações a frio e reduzindo o enfileiramento de solicitações durante picos de tráfego. Isto é fundamental ao suportar até 500.000 chamadas simultâneas com requisitos rígidos de latência. As políticas de escalabilidade automática permitem que o aplicativo ajuste dinamicamente a capacidade com base na demanda, garantindo eficiência de custos fora dos horários de pico e mantendo o desempenho durante o pico de uso. Isto apoia diretamente o requisito de permanecer dentro de um orçamento de computação mensal predefinido. A opção A falha porque o processamento em lote e os modelos de raciocínio complexos introduzem maior latência e não são adequados para sugestões em tempo real. A opção C introduz custos operacionais e custos significativamente maiores devido a instâncias de GPU dedicadas e responsabilidades de escalonamento manual. A opção D é otimizada para cargas de trabalho em lote e não pode atender ao requisito de latência inferior a 200 ms. Portanto, a Opção B oferece o melhor equilíbrio entre desempenho, escalabilidade, controle de custos e simplicidade operacional usando serviços GenAI nativos da AWS.
Quer todas as 119 questões por R$ 198,00?