Video Experimental Relacionado
Updated: May 1, 2026

Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
Evaluación de grandes modelos de lenguaje como clasificadores de preguntas médicas de respuestas cortas: un análisis
Olena Bolgova1, Paul Ganguly1, Muhammad Faisal Ikram1
1College of Medicine, Alfaisal University, Riyadh, Kingdom of Saudi Arabia.
Los Grandes Modelos de Lenguaje (LLM) son prometedores para la calificación de preguntas médicas de respuestas cortas, pero el rendimiento varía según el modelo y la disciplina médica. Los criterios de expertos no mejoraron consistentemente la precisión de LLM, lo que requirió la implementación específica del dominio y la supervisión humana.
Área de la Ciencia:
- Evaluación de la educación médica
- Inteligencia artificial en el cuidado de la salud
- Procesamiento del lenguaje natural
Sus antecedentes:
- La evaluación de la educación médica de las preguntas con respuestas cortas (SAQ) requiere mucho tiempo y la participación de expertos.
- Los grandes modelos de lenguaje (LLM) presentan una solución potencial para la automatización de la calificación SAQ.
- La eficacia de los LLM en contextos de evaluación médica especializada no está bien establecida.
Objetivo del estudio:
- Evaluar el rendimiento de calificación de cinco LLM frente a calificadores humanos expertos para las SAQ médicas.
- Para comparar las capacidades de LLM en diferentes disciplinas médicas (anatomía, histología, embriología, fisiología).
- Evaluar el impacto de proporcionar rúbricas de calificación definidas por expertos en el rendimiento del LLM.
Principales métodos:
- Análisis de las respuestas SAQ de 804 estudiantes en cuatro sujetos médicos.
- Calificación de las respuestas por tres miembros expertos de la facultad humana.
- Evaluación de cinco LLM (GPT-4.1, Gemini, Claude, Copilot, DeepSeek) utilizando dos enfoques: criterios generados por los mismos y rúbricas proporcionadas por expertos.
- Medida del acuerdo utilizando el coeficiente de correlación intraclase (ICC) y el Kappa de Cohen.
Principales resultados:
- Se observó un acuerdo sustancial entre expertos (Kappa promedio: 0,69, ICC: 0,86).
- El rendimiento del LLM varió significativamente entre los tipos y modelos de preguntas, sin que ningún LLM superara constantemente a otros.
- El mayor acuerdo experto-LLM fue logrado por Claude (Kappa: 0.61) en una pregunta y DeepSeek (Kappa: 0.53) en otra.
- El impacto de los criterios de expertos en el desempeño de la LLM fue inconsistente.
- Los LLM mostraron una variación significativa en la rigurosidad de la calificación en comparación con los expertos y mostraron diferencias de calificación específicas de dominio.
Conclusiones:
- Los LLM demuestran potencial para apoyar la evaluación médica de la SAQ, pero presentan variaciones de rendimiento específicas de cada dominio.
- La provisión de rúbricas expertas no mejoró consistentemente la precisión de la calificación de LLM.
- La implementación exitosa de las LLM en la evaluación de la educación médica requiere una cuidadosa consideración de dominios específicos y una supervisión humana continua.
Más Videos Relacionados
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
Videos de Conceptos Relacionados
Classification of Illness
An illness is a response to a disease in which the person's level of functioning is changed compared with a previous level. The general classification of illness includes acute and chronic.
Acute illness is severe...
Sensitivity, Specificity, and Predicted Value
Sensitivity is the...