Questão 8 — Simulado AWS Certified AI Practitioner (AIP-C01) – Questões Atualizadas
Uma empresa deseja selecionar um novo FM para seu assistente de IA. Um desenvolvedor GenAI precisa gerar relatórios de avaliação para ajudar um cientista de dados a avaliar a qualidade e a segurança de vários modelos básicos de FMs. O cientista de dados fornece ao desenvolvedor GenAI exemplos de solicitações para avaliação. O desenvolvedor GenAI deseja usar o Amazon Bedrock para automatizar a geração e avaliação de relatórios. Qual solução atenderá a esse requisito?
- A. Combine os prompts de amostra em um único documento JSON. Crie uma base de conhecimento do Amazon Bedrock com o documento. Escreva um prompt que solicite ao FM que gere uma resposta para cada exemplo de prompt. Use a API RetrieveAndGenerate para gerar um relatório para cada modelo.
- B. Combine os prompts de amostra em um único documento JSONL. Armazene o documento em um bucket do Amazon S3. Crie um trabalho de avaliação do Amazon Bedrock que use um modelo de juiz. Especifique o local do S3 como entrada e um local do S3 diferente como saída. Execute um trabalho de avaliação para cada FM e selecione o FM como gerador.
- C. Combine os prompts de amostra em um único documento JSONL. Armazene o documento em um bucket do Amazon S3. Crie um trabalho de avaliação do Amazon Bedrock que use um modelo de juiz. Especifique o local do S3 como entrada e o Amazon QuickSight como saída. Execute um trabalho de avaliação para cada FM e selecione o FM como avaliador.
- D. Combine os prompts de amostra em um único documento JSON. Crie uma base de conhecimento do Amazon Bedrock a partir do documento. Crie um trabalho de avaliação do Amazon Bedrock que use o tipo de avaliação de recuperação e geração de resposta. Especifique um bucket do Amazon S3 como saída. Execute um trabalho de avaliação para cada FM.
Resposta correta:
B
Explicação
Explicação: A opção B está correta porque usa o recurso de avaliação gerenciada no Amazon Bedrock que se destina especificamente à comparação de modelos básicos usando um conjunto de prompts consistente e produzindo resultados estruturados com o mínimo de ferramentas personalizadas. Em um fluxo de trabalho de avaliação Bedrock, você fornece um conjunto de dados de entrada de prompts, normalmente no formato JSON Lines para que cada linha represente um registro de avaliação. Armazenar o arquivo JSONL no Amazon S3 permite que a Bedrock leia o conjunto de dados em escala e grave resultados de avaliação padronizados de volta no S3 para análise downstream, compartilhamento e retenção. O principal requisito é avaliar a qualidade e a segurança em vários modelos. Um trabalho de avaliação Bedrock pode usar um modelo de juiz para pontuar os resultados gerados em relação a critérios definidos. Essa abordagem suporta comparações repetíveis e iguais porque o mesmo modelo de juiz e rubrica de pontuação podem ser aplicados a cada modelo de base candidato. Os modelos candidatos são configurados como geradores, o que significa que cada execução de trabalho de avaliação usa um FM selecionado para produzir respostas para o mesmo conjunto de prompts, e o modelo juiz avalia essas respostas. Isso atende ao requisito de gerar relatórios de avaliação que ajudem um cientista de dados a selecionar o melhor FM. A opção A não usa trabalhos de avaliação Bedrock e uma base de conhecimento mais RetrieveAndGenerate é um padrão RAG, não uma estrutura de avaliação. Produziria respostas, mas não uma pontuação e relatórios padronizados adequados para a seleção do modelo. A opção C está incorreta porque os resultados da avaliação Bedrock são entregues ao S3, e não diretamente a um destino de BI, e a seleção do FM candidato como avaliador entra em conflito com o padrão pretendido de uso de um modelo de juiz estável. A Opção D utiliza indevidamente as bases de conhecimento e os tipos de avaliação de recuperação quando o requisito é a avaliação do modelo com base imediata, em vez de avaliar a qualidade da recuperação.
Quer todas as 119 questões por R$ 198,00?