Questão 10 — Simulado AWS Certified AI Practitioner (AIP-C01) – Questões Atualizadas
Uma empresa de serviços financeiros usa um aplicativo de IA para processar documentos financeiros usando o Amazon Bedrock. Durante o horário comercial, o aplicativo processa aproximadamente 10.000 solicitações por hora, o que exige uma taxa de transferência consistente. A empresa usa a API CreateProvisionedModelThroughput para adquirir a taxa de transferência provisionada. As métricas do Amazon CloudWatch mostram que a capacidade provisionada não é utilizada enquanto as solicitações sob demanda estão sendo limitadas. A empresa encontra o seguinte código no aplicativo: python response = bedrock_runtime.invoke_model(modelId="anthropic.claude-v2", body=json.dumps(payload)) A empresa precisa que o aplicativo use a taxa de transferência provisionada e resolva os problemas de limitação. Qual solução atenderá a esses requisitos?
- A. Aumente o número de unidades de modelo (MUs) na configuração de taxa de transferência provisionada.
- B. Substitua o parâmetro de ID do modelo pelo ARN do modelo provisionado que a API CreateProvisionedModelThroughput retorna.
- C. Adicione lógica de repetição de espera exponencial para lidar com exceções de limitação durante horários de pico.
- D. Modifique o aplicativo para usar a API InvokeModelWithResponseStream em vez de a API InvokeModel.
Resposta correta:
B
Explicação
Explicação: A opção B está correta porque o aplicativo está atualmente invocando o identificador do modelo básico, que roteia o tráfego para o pool de capacidade sob demanda em vez do rendimento provisionado adquirido pela empresa. No Amazon Bedrock, a taxa de transferência provisionada é anexada a um recurso provisionado específico criado por meio das APIs de taxa de transferência provisionada. Para consumir essa capacidade reservada, as solicitações de inferência devem ter como alvo o identificador de recurso provisionado que representa o rendimento adquirido, e não o identificador de modelo genérico usado para inferência sob demanda. O trecho de código usa modelId="anthropic.claude-v2". Este valor seleciona o ponto final sob demanda para esse modelo. Como resultado, as solicitações estão sujeitas a cotas sob demanda e comportamento de limitação, enquanto a taxa de transferência provisionada permanece ociosa. Isso explica diretamente a observação do CloudWatch: as métricas de capacidade provisionada mostram capacidade não utilizada porque nenhum tráfego está sendo direcionado para o recurso provisionado, e o caminho sob demanda está sendo limitado porque excede os limites sob demanda aplicáveis durante o volume de pico. Substituir o valor modelId pelo ARN de throughput provisionado retornado pelo fluxo de trabalho CreateProvisionedModelThroughput garante que a invocação do tempo de execução seja roteada para a capacidade reservada. Depois que o tráfego é direcionado corretamente, as unidades de modelo adquiridas fornecem o rendimento consistente necessário para um desempenho previsível durante o horário comercial, e é exatamente por isso que o rendimento provisionado é usado. A opção A poderia aumentar a capacidade, mas não resolve o problema central de que o aplicativo não está usando o recurso provisionado. A opção C pode reduzir temporariamente o impacto da limitação, mas adiciona latência e não garante um rendimento consistente; também ainda desperdiça a capacidade provisionada. A opção D altera o mecanismo de entrega de resposta, mas a limitação é um problema de roteamento de capacidade e de cota, não um problema de API de streaming.
Quer todas as 119 questões por R$ 198,00?