Video Experimental Relacionado
Updated: Feb 26, 2026

03:14
Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.2K
Comparación de modelos de lenguaje grandes para la generación de escenarios clínicos en educación médica: un estudio
1Department of Medical Education, Faculty of Medicine, Aydın Adnan Menderes University, Aydın, Turkey. selcenoncu@gmail.com.
BMC medical education
|February 24, 2026
Resumen
La IA Claude demostró un rendimiento superior en la generación de escenarios de casos clínicos realistas y pedagógicamente sólidos para estudiantes de medicina turcos. Esta herramienta de IA ofrece un complemento prometedor a los métodos tradicionales de educación médica.
Área de la Ciencia:
- Educación Médica
- Inteligencia Artificial en la Atención Sanitaria
- Simulación Clínica
Sus antecedentes:
- El entrenamiento tradicional en el manejo de casos clínicos enfrenta desafíos debido a la seguridad del paciente, las oportunidades limitadas y la carga de trabajo del profesorado.
- La inteligencia artificial (IA), en particular los modelos de lenguaje grandes (LLM), presenta soluciones innovadoras para complementar la formación clínica.
- Los LLM pueden generar escenarios clínicos diversos, interactivos y específicos del contexto para la educación médica basada en competencias.
Objetivo del estudio:
- Evaluar y comparar la efectividad de cuatro LLM (ChatGPT-4o, Claude 3.7 Sonnet, Gemini 1.5, DeepSeek) en la generación de escenarios clínicos.
- Evaluar la utilidad educativa de los escenarios generados por LLM para la educación médica de pregrado en Turquía.
- Identificar el LLM que produce el contenido más preciso, comprensible y pedagógicamente apropiado, alineado con los estándares nacionales.
Principales métodos:
- Diseño convergente paralelo de métodos mixtos utilizando indicaciones estandarizadas basadas en las directrices nacionales de educación médica.
- Generación de escenarios clínicos en idioma turco para tres enfermedades infecciosas comunes por cada LLM.
- Evaluación de los escenarios por 25 estudiantes de medicina de último año y 5 médicos expertos utilizando formularios de calificación estructurados y retroalimentación cualitativa.
Principales resultados:
- Claude 3.7 Sonnet recibió las calificaciones más altas en claridad, realismo y apoyo al razonamiento clínico.
- Las diferencias estadísticamente significativas favorecieron a Claude sobre Gemini y DeepSeek (p < 0.05).
- La retroalimentación cualitativa destacó el valor educativo y la precisión lingüística de Claude.
- ChatGPT tuvo un rendimiento moderado, mientras que Gemini y DeepSeek tuvieron problemas de realismo y coherencia.
Conclusiones:
- Claude fue calificado más alto por generar escenarios en idioma turco clínicamente apropiados y pedagógicamente útiles para la educación médica de pregrado.
- Los hallazgos proporcionan evidencia preliminar sobre la calidad de los escenarios generados por LLM, apoyando estudios multicéntricos adicionales centrados en los resultados.
- La investigación futura debe explorar los escenarios de LLM como materiales complementarios en el aprendizaje basado en simulación.
Palabras clave:
Escenario basado en IAInteligencia artificialGeneración de escenarios clínicosModelos de lenguaje grandesEducación médicaAprendizaje basado en simulación
