Video Experimental Relacionado
Updated: Sep 9, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Evaluación comparativa del rendimiento de los grandes modelos de lenguaje en la educación médica utilizando la
Anikó Szabó1, Ghasem Dolatkhah Laein2
1Department of Anatomy and Genetics, College of Medicine, Alfaisal University, Riyadh, Saudi Arabia.
Los grandes modelos de lenguaje (LLM) son prometedores para la educación médica, pero el rendimiento varía. La evaluación sistemática es crucial para seleccionar las mejores herramientas de IA para tareas educativas específicas como preguntas de histología y escenarios clínicos.
Área de la Ciencia:
- Tecnología de la educación médica
- Inteligencia artificial en el cuidado de la salud
- Educación en histología
Sus antecedentes:
- Los grandes modelos lingüísticos (LLM) ofrecen beneficios potenciales para la educación médica.
- Se requiere una evaluación sistemática de las capacidades específicas de los LLM.
- La histología del sistema urinario es un área clave para la capacitación médica.
Objetivo del estudio:
- Evaluar comparativamente trece grandes modelos de lenguaje (LLM) en la educación histológica del sistema urinario.
- Evaluar el rendimiento del LLM en dos tareas distintas: preguntas de opción múltiple (MCQ) y generación de escenarios clínicos.
- Para analizar las capacidades de LLM utilizando un marco multidimensional.
Principales métodos:
- Evaluó trece LLM en 65 MCQ validados y generación de escenarios clínicos.
- Evaluación del rendimiento de las MCQ a través de la precisión y la calidad de la explicación (relevancia, exhaustividad).
- Generación de escenarios evaluados a través de la calidad, la complejidad, la relevancia, la corrección y la variedad.
Principales resultados:
- El rendimiento varió significativamente entre los LLM y las tareas.
- ChatGPT-o1 logró la mayor precisión de MCQ (96,31%).
- Claude-3.5 sobresalió en la generación de escenarios clínicos (91,4% de la puntuación máxima).
- Todos los modelos superaron significativamente las conjeturas aleatorias en las MCQ.
- Los modelos mostraron mayor exactitud que calidad en la generación de escenarios.
- El análisis de la frecuencia de los términos reveló desequilibrios de contenido y omisiones.
Conclusiones:
- Los LLM son muy prometedores para la educación médica, pero requieren una selección cuidadosa para tareas específicas.
- La implementación fiable requiere la adecuación de los modelos a las necesidades educativas y el empleo de mecanismos de verificación.
- Los LLM actuales tienen limitaciones en la generación de contenidos pedagógicamente equilibrados.
Videos de Conceptos Relacionados
Imaging Studies I: Kidney, Ureter, and Bladder Studies
Nursing Assessment of the Genitourinary System II: Inspection and Palpation
Urinary Tract Infection III: Diagnostic Studies and Interprofessional Care

