Video Experimental Relacionado
Updated: Sep 10, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
El uso de grandes modelos de lenguaje entrenados para la evaluación impulsada por la IA en la educación médica
Jacob Cole1, Joshua Duncan2, Rebekah Cole3
1J. Cole is associate professor, Department of Anesthesiology and Department of Military and Emergency Medicine, Uniformed Services University of the Health Sciences, Bethesda, Maryland.
Los grandes modelos de lenguaje (LLM) son prometedores para evaluar la comprensión de los estudiantes de medicina de las lesiones morales, ofreciendo evaluaciones más objetivas y eficientes. Este enfoque impulsado por la IA puede mejorar la retroalimentación y los resultados educativos en la capacitación en ética médica.
Área de la Ciencia:
- Educación médica
- Inteligencia artificial en el cuidado de la salud
- Ética en la medicina
Sus antecedentes:
- La evaluación de estudiantes de medicina en programas basados en competencias es un desafío debido a las limitaciones de tiempo y la necesidad de retroalimentación objetiva.
- Los métodos de evaluación tradicionales pueden carecer de coherencia y retroalimentación específica, especialmente en temas complejos como el daño moral.
Objetivo del estudio:
- Pilotear el uso de grandes modelos de lenguaje (LLM) con generación aumentada de recuperación para evaluar la comprensión de los estudiantes sobre el daño moral.
- Evaluar la eficiencia, objetividad y efectividad de la evaluación basada en LLM en un curso de ética médica.
Principales métodos:
- Los LLM (Google Gemini 1.5 Pro, Google Gemini 2.0 Flash, OpenAI ChatGPT-4o) se utilizaron para generar una rúbrica de calificación a partir de artículos seminales sobre el daño moral.
- 165 respuestas de los estudiantes fueron evaluadas por tres LLM utilizando la rúbrica generada.
- La precisión de la puntuación de LLM se comparó con dos educadores experimentados para establecer pruebas de validez.
Principales resultados:
- Google Gemini 1.5 Pro generó con éxito una rúbrica de calificación matizada para el daño moral.
- OpenAI ChatGPT-4o logró la mayor confiabilidad entre los evaluadores (0,77 y 0,68) en comparación con los evaluadores humanos, superando el acuerdo entre los evaluadores (0,57).
Conclusiones:
- Los LLM ofrecen una herramienta prometedora para mejorar la eficiencia y la objetividad de la evaluación de los estudiantes de medicina, especialmente en temas éticos especializados.
- La supervisión de la facultad es crucial para garantizar la responsabilidad ética y mitigar los posibles sesgos en las evaluaciones impulsadas por la IA.

