Video Experimental Relacionado
Updated: May 6, 2026

07:30
Learning Modern Laryngeal Surgery in a Dissection Laboratory
Published on: March 18, 2020
8.2K
Los grandes modelos lingüísticos tienen un rendimiento inferior en los exámenes europeos de cirugía general: un
1Department of Gastrointestinal Surgery, Afyonkarahisar State Hospital, Afyonkarahisar, Türkiye. opdrmelihcangul@gmail.com.
BMC medical education
|August 24, 2025
Resumen
Los modelos de inteligencia artificial (IA) muestran una menor precisión que los cirujanos humanos en las preguntas del examen a bordo. Las herramientas de IA se utilizan mejor para complementar, no reemplazar, el juicio clínico experto en la educación quirúrgica.
Área de la Ciencia:
- Educación médica
- Inteligencia artificial
- Evaluación quirúrgica
Sus antecedentes:
- La inteligencia artificial (IA) se utiliza cada vez más en la educación y evaluación médicas.
- Los modelos de IA como GPT-4o muestran un rendimiento variable en exámenes médicos de alto riesgo.
- Este estudio evalúa el rendimiento de la IA frente a expertos humanos en pruebas quirúrgicas.
Objetivo del estudio:
- Comparar la precisión de cuatro modelos de IA (Llama-3, Gemini, GPT-4o, Copilot) con las preguntas de especialistas y residentes del Consejo Europeo de Cirugía General.
- Analizar el rendimiento de la IA en función del formato, la longitud y la dificultad de las preguntas.
- Determinar el papel actual de la IA en la educación y evaluación quirúrgica.
Principales métodos:
- Se utilizaron 120 preguntas de opción múltiple del examen de cirugía general.
- Cuatro modelos de IA y 30 cirujanos (especialistas y residentes) respondieron preguntas en condiciones cronometradas.
- Las preguntas se clasificaron por longitud y dificultad, con precisión comparada utilizando ANOVA.
Principales resultados:
- Los cirujanos certificados lograron una precisión del 81,6%, los residentes del 69,9%.
- Llama-3 tuvo el mejor rendimiento entre los modelos de IA con un 65,8%, Copilot el más bajo con un 51,7%.
- El rendimiento de la IA disminuyó con la longitud y la dificultad de las preguntas, a diferencia del rendimiento humano.
Conclusiones:
- Los modelos de lenguaje grande (LLM) actuales tienen un rendimiento inferior al de los especialistas humanos en las evaluaciones de conocimiento médico de alto nivel.
- Los LLM son valiosas herramientas complementarias en la educación quirúrgica.
- La IA no debe sustituir el juicio clínico experto en la práctica quirúrgica.

