Questão 28 — Amazon AIF-C01 Simulado | AWS Certified AI Practitioner Questões e Respostas
Qual termo é a velocidade com que um modelo básico (FM) pré-treinado processa solicitações e entrega resultados?
- A. Tamanho do modelo
- B. Latência de inferência
- C. Janela de contexto
- D. Ajuste fino
Resposta correta:
B
Explicação
Explicação: explicação abrangente e detalhada de documentos exatos de IA da AWS: A latência de inferência mede o tempo que um modelo leva para: Receber uma solicitação de entrada Processar a solicitação Retornar uma saída A orientação de desempenho da AWS enfatiza a latência de inferência como uma métrica crítica para aplicativos de IA em tempo real e voltados para o usuário. Por que as outras opções estão incorretas: O tamanho do modelo (A) refere-se ao número de parâmetros. A janela de contexto (C) define a capacidade de comprimento de entrada. O ajuste fino (D) é um processo de customização. Referências de documentos de IA da AWS: Considerações sobre latência de métricas de desempenho do modelo básico para aplicativos de IA Otimizando inferência na AWS