Questão 45 — SK0-005 CompTIA Server+ Simulado Online Grátis
Durante a seleção de um modelo de classificação de ameaças baseado em aprendizado de máquina (ML), um administrador de segurança cibernética verifica se a distribuição de rótulos é altamente desequilibrada. Qual das seguintes técnicas de processamento o engenheiro deve usar para equilibrar o modelo?
- A. Linhagem de dados
- B. Aumento de dados
- C. Proveniência de dados
- D. Verificação de dados
Resposta correta:
B
Explicação
Explicação: Conceito Básico: O desequilíbrio de classe nos dados de treinamento - onde algumas categorias têm significativamente mais exemplos do que outras - faz com que os modelos de ML sejam tendenciosos em direção à classe majoritária, produzindo uma detecção deficiente de ameaças de classes minoritárias. Resolver esse desequilíbrio antes do treinamento é fundamental para a precisão da classificação de ameaças. CompTIA SecAI+ cobre técnicas de preparação de dados sob conceitos básicos de IA. Por que B está correto: o aumento de dados aborda o desequilíbrio de classes aumentando artificialmente o número de amostras de treinamento em classes sub-representadas. As técnicas incluem superamostragem de classes minoritárias, criando exemplos sintéticos usando métodos como SMOTE (Synthetic Minority Over-sampling Technique) ou subamostragem de classes majoritárias. Isso equilibra a distribuição de rótulos e permite que o modelo aprenda limites de decisão que classificam com precisão todas as categorias de ameaças, não apenas as dominantes. Por que A está errado: a linhagem de dados documenta a origem, a movimentação e a transformação dos dados ao longo de seu ciclo de vida. Ele fornece rastreabilidade e auditabilidade, mas não aborda o desequilíbrio de classes na distribuição de dados de treinamento. Por que C está errado: a proveniência dos dados registra o histórico e o contexto das origens dos dados. Assim como a linhagem, é um conceito de governança e rastreamento que não altera a distribuição de dados para o equilíbrio do treinamento do modelo. Por que D está errado: A verificação de dados confirma que os dados estão corretos e consistentes com os formatos e valores esperados. Ele verifica a qualidade e a integridade dos dados, mas não aborda o desequilíbrio da distribuição estatística entre as classes de ameaças nos conjuntos de dados de treinamento.
Quer todas as 123 questões por R$ 198,00?