Video Experimental Relacionado
Updated: Jan 7, 2026

Use of Galvanic Skin Responses, Salivary Biomarkers, and Self-reports to Assess Undergraduate Student Performance During a Laboratory Exam Activity
Published on: February 10, 2016
Evaluación comparativa de preguntas de opción múltiple generadas por ChatGPT frente a ítems de profesores en
Amber Kiyani1, Fariha Hanif2, Muhammad Muhammad2
1Qatar University, Doha, Qatar. a.kiyani@qu.edu.qa.
This study compared ChatGPT-generated multiple-choice questions (MCQs) with instructor-written ones for dental students. Instructor items performed better, but AI-generated questions show future potential in educational assessments.
Área de la Ciencia:
- Tecnología Educativa; Inteligencia Artificial en la Educación; Educación Médica
Sus antecedentes:
- Los modelos de lenguaje grandes (LLM) se utilizan cada vez más en el autoaprendizaje de los estudiantes.; Es crucial evaluar la calidad del contenido educativo generado por IA para una integración efectiva.; La evaluación comparativa de herramientas de IA con métodos tradicionales proporciona información sobre su utilidad.
Objetivo del estudio:
- Comparar las propiedades psicométricas de los ítems de evaluación generados por ChatGPT-3.5 con los creados por instructores.; Evaluar el rendimiento de las preguntas de opción múltiple (POM) generadas por IA en un contexto de Medicina Oral para estudiantes de odontología de pregrado.; Analizar la confiabilidad, dificultad y discriminación de los ítems de evaluación generados por IA y creados por instructores.
Principales métodos:
- Se desarrolló una evaluación de Medicina Oral de 40 ítems, que comprende 20 POM creadas por instructores y 20 por ChatGPT-3.5.; La evaluación se administró a 547 estudiantes de odontología de pregrado en cuatro instituciones.; Se utilizó la Teoría de Respuesta al Ítem, específicamente el modelo logístico de 3 parámetros, para el análisis de datos.
Principales resultados:
- Los ítems del instructor demostraron una mayor confiabilidad de la persona (0.845) en comparación con los ítems de ChatGPT (0.778).; Los ítems del instructor mostraron un rango de dificultad más amplio (-1.29 a 3.22) y una mayor discriminación (0.50 a 4.64) que los ítems de ChatGPT.; Si bien los ítems del instructor tuvieron puntajes promedio más altos y variabilidad, los ítems de ChatGPT exhibieron propiedades psicométricas prometedoras con un bajo parámetro de adivinanza.
Conclusiones:
- Los ítems de evaluación generados por la facultad exhiben actualmente propiedades psicométricas superiores, incluida una mejor discriminación y rango de dificultad.; Los ítems generados por ChatGPT muestran potencial para la generación de POM en entornos educativos, lo que justifica una mayor investigación.; Los LLM como ChatGPT pueden desempeñar un papel importante en el desarrollo de futuras evaluaciones educativas, superando potencialmente las capacidades humanas.
Más Videos Relacionados
13:44Project-Based Learning Guidelines for Health Sciences Students: An Analysis with Data Mining and Qualitative Techniques
Published on: December 9, 2022
07:42Quasistatic Mechanical Testing for Computer-Aided Design and Manufacturing Occlusal Veneers Cemented to Milled Dentin Analog Material
Published on: December 20, 2024
Videos de Conceptos Relacionados
Assessment of the Mouth
Mouth Inspection
The inspection begins with visually examining the mouth for symmetry, color, and size.
Surveys
Biostatistics: Overview
Discrete variables are...
The Availability Heuristic
Comparing Experimental Results: Student's t-Test
Pre-Procedural Guidelines for Assessing Blood Pressure