Video Experimental Relacionado
Updated: Feb 20, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Modelos de Lenguaje Grandes Ajustados para Generar Preguntas de Opción Múltiple en Anestesiología: Comparación
Carlos Ramon Hölzing1, Charlotte Meynhardt1, Patrick Meybohm1
1Department of Anaesthesiology, Intensive Care, Emergency and Pain Medicine, University Hospital Würzburg, Oberdürrbacher Str. 6, Würzburg, 97080, Germany.
Los modelos de lenguaje grandes (LLM) ajustados pueden crear preguntas de opción múltiple (POM) en anestesiología con propiedades psicométricas similares a las escritas por expertos de la facultad. La generación automatizada de ítems puede complementar, no reemplazar, los métodos tradicionales para desarrollar evaluaciones de alta calidad en educación médica.
Área de la Ciencia:
- Educación Médica
- IA en Evaluación
- Psicometría
Sus antecedentes:
- Las preguntas de opción múltiple (POM) son cruciales para la evaluación médica estandarizada.
- El desarrollo de POM de alta calidad requiere experiencia en la materia y una metodología rigurosa.
- Los modelos de lenguaje grandes (LLM) presentan oportunidades para la generación automatizada de POM, pero las evaluaciones son limitadas.
Objetivo del estudio:
- Evaluar si un LLM ajustado puede generar POM de anestesiología con propiedades psicométricas comparables a los ítems escritos por profesores.
Principales métodos:
- Se entrenó un modelo GPT-4 ajustado con materiales de anestesiología.
- El modelo generó 15 POM, que se analizaron junto con 15 POM escritas por profesores.
- El análisis de ítems siguió los estándares psicométricos, comparando la dificultad, la correlación punto-biserial y el índice de discriminación.
Principales resultados:
- No se encontraron diferencias significativas en dificultad, correlación punto-biserial o índice de discriminación entre las POM generadas por LLM y las escritas por profesores.
- Ambos conjuntos de POM demostraron una calidad psicométrica general modesta.
- Los ítems generados por LLM (dificultad media 0,79, punto-biserial 0,17, discriminación 0,08) fueron comparables a los ítems de expertos (dificultad media 0,81, punto-biserial 0,19, discriminación 0,09).
Conclusiones:
- Los LLM ajustados supervisados pueden producir POM con una calidad psicométrica similar a la de los profesores expertos.
- La generación automatizada de ítems debe complementar, no reemplazar, el desarrollo manual de POM.
- Se necesita más investigación para la generalización y la optimización de la integración de LLM en la evaluación.
Videos de Conceptos Relacionados
Self-Report Tests of Personality
Local Anesthetics: Differential Sensitivity of Nerve Fibers

