Video Experimental Relacionado
Updated: Mar 1, 2026

Author Spotlight: Validation of SICOLE-R for Assessing Cognitive and Reading Skills in Spanish-Speaking Children and Its Role in Personalized Education
Published on: August 16, 2024
Evaluación de la profundidad cognitiva de preguntas de opción múltiple generadas por IA con la taxonomía de Bloom
Trang Thi Nguyen1, Linh Nguyen2, Ha Thi Nguyet Do2
1Faculty of Dentistry, Phenikaa University, Hanoi, Vietnam.
Los modelos de lenguaje grandes (LLM) muestran un buen rendimiento en la generación de preguntas de opción múltiple (MCQ) de nivel inferior de la taxonomía de Bloom. Claude Sonnet 4 demostró una alineación superior con las habilidades cognitivas de orden superior en la educación médica.
Área de la Ciencia:
- Educación Médica
- Inteligencia Artificial en la Educación
- Ciencias Cognitivas
Sus antecedentes:
- Los modelos de lenguaje grandes (LLM) se utilizan cada vez más para generar contenido educativo, incluidas las preguntas de opción múltiple (MCQ).
- La alineación de las MCQ generadas por LLM con marcos educativos establecidos como la taxonomía de Bloom no ha sido investigada a fondo.
- Este estudio se centra en evaluar la capacidad de los LLM para crear MCQ en diferentes niveles cognitivos dentro de la anatomía oral y maxilofacial.
Objetivo del estudio:
- Evaluar la alineación de múltiples modelos de lenguaje grandes (LLM) de uso generalizado con los niveles cognitivos de la taxonomía de Bloom.
- Comparar el rendimiento de diferentes LLM en la generación de MCQ en los niveles de recordar, comprender, aplicar, analizar y evaluar/crear.
- Identificar qué LLM apoyan mejor las habilidades de pensamiento de orden superior en la generación de contenido de educación médica.
Principales métodos:
- Cinco LLM líderes (ChatGPT-4o, Copilot Pro, Claude Sonnet 4, Grok 3, DeepSeek R1) generaron 300 MCQ a partir de un libro de texto de anatomía oral y maxilofacial.
- Las MCQ estaban diseñadas para abordar cinco niveles cognitivos de la taxonomía de Bloom.
- Dos investigadores independientes calificaron cada MCQ utilizando una escala Likert de 5 puntos, con la fiabilidad interevaluador evaluada mediante el kappa ponderado de Cohen.
Principales resultados:
- La fiabilidad interevaluador fue de moderada a fuerte (kappa = 0,74–0,86).
- Todos los LLM tuvieron un buen rendimiento en los niveles cognitivos inferiores (recordar, comprender, aplicar, evaluar/crear), con puntuaciones medianas superiores a 4.
- Claude Sonnet 4 mostró un rendimiento superior en los niveles cognitivos superiores (aplicar, analizar, evaluar/crear) en comparación con otros modelos.
- ChatGPT-4o, DeepSeek R1 y Grok 3 demostraron un sesgo significativo hacia los niveles cognitivos inferiores.
Conclusiones:
- Los LLM generalmente tienen un buen rendimiento en la generación de MCQ para los niveles cognitivos inferiores de la taxonomía de Bloom.
- Claude Sonnet 4 exhibe la mayor alineación con las habilidades de pensamiento de orden superior entre los LLM evaluados.
- Los hallazgos sugieren capacidades variables de los LLM para apoyar el desarrollo integral de habilidades cognitivas en la educación médica.
Más Videos Relacionados
Videos de Conceptos Relacionados
Multiple Intelligences Theory
Cognitive Learning
E. C. Tolman's theory of purposive behavior emphasizes that much behavior is goal-directed. He argued that to understand behavior, we must look at the entire sequence of actions leading to a goal. For instance, high school students study hard, not just due to past reinforcement but also to achieve the goal of getting into a good college.
Tolman introduced the idea that behavior is influenced by...
Critical Thinking II
Measures of Intelligence
Validity refers to how well a test measures what it claims to measure. An intelligence test should accurately assess intelligence rather than another characteristic, like anxiety. Criterion validity is one way to evaluate this;...
Introduction to Cognitive Psychology
This field emerged in the mid-20th century, following a period dominated by behaviorism, which...
Lazarus's Cognitive Appraisal Theory
Primary Appraisal:...

