Video Experimental Relacionado
Updated: Jan 8, 2026

Project-Based Learning Guidelines for Health Sciences Students: An Analysis with Data Mining and Qualitative Techniques
Published on: December 9, 2022
Comparación de ChatGPT y DeepSeek para la Evaluación de Preguntas de Opción Múltiple en Educación Médica Ortopédica:
Chirathit Anusitviwat1, Sitthiphong Suwannaphisit2, Jongdee Bvonpanttarananon1
1Department of Orthopedics, Faculty of Medicine, Prince of Songkla University, 15 Karnchanavanich Road, Hat Yai, 90110, Thailand, 66 74451601.
ChatGPT demostró un rendimiento superior a DeepSeek en la evaluación de preguntas de opción múltiple (POM) en ortopedia, mostrando mayor precisión y tiempos de respuesta más rápidos. Esto sugiere que los modelos de lenguaje grandes (LLM) como ChatGPT pueden ayudar de manera eficiente en las evaluaciones de educación médica.
Área de la Ciencia:
- Educación Médica; Inteligencia Artificial en la Atención Médica; Cirugía Ortopédica
Sus antecedentes:
- Las preguntas de opción múltiple (POM) son vitales para evaluar el conocimiento médico y el razonamiento clínico.; El desarrollo tradicional de POM requiere muchos recursos y es propenso a sesgos.; Los modelos de lenguaje grandes (LLM) ofrecen potencial para una evaluación eficiente y precisa de POM.
Objetivo del estudio:
- Comparar el rendimiento de ChatGPT y DeepSeek en la evaluación de POM de ortopedia.; Evaluar la corrección, el tiempo de respuesta y la confiabilidad de las respuestas generadas por LLM.; Identificar posibles ambigüedades en las POM respondidas incorrectamente por ambos modelos.
Principales métodos:
- Un estudio transversal analizó 209 POM de ortopedia.; Se utilizó ChatGPT y DeepSeek para responder POM, y se anotaron funciones específicas.; Se compararon análisis estadísticos (prueba χ2, prueba U de Mann-Whitney, κ de Cohen) de corrección, tiempos de respuesta y confiabilidad.; El profesorado de ortopedia revisó las POM respondidas incorrectamente por ambos LLM.
Principales resultados:
- ChatGPT logró una mayor corrección (80,38%) que DeepSeek (74,2%; P=.04).; ChatGPT tuvo tiempos de respuesta significativamente más cortos (10,40 s) en comparación con DeepSeek (34,42 s; P<.001).; ChatGPT mostró un acuerdo casi perfecto (κ=0,81), mientras que DeepSeek tuvo un acuerdo sustancial (κ=0,78).
Conclusiones:
- ChatGPT es más eficiente y preciso que DeepSeek para la evaluación de POM de ortopedia.; Los LLM muestran potencial para la integración en las evaluaciones de educación médica.; Algunas POM requieren revisión por parte del profesorado para mejorar la claridad, lo que destaca la necesidad de supervisión humana.
Más Videos Relacionados
06:28E-Patient Counseling Trial E-PACO: Computer Based Education versus Nurse Counseling for Patients to Prepare for Colonoscopy
Published on: August 1, 2019
05:04Author Spotlight: Evaluating Clinicians' Adoption of Ultrasound-Guided Vascular Cannulation Through Simulation Training
Published on: August 9, 2024