Video Experimental Relacionado
Updated: Feb 17, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
¿Puede la inteligencia artificial aprobar el examen? Evaluación de las puntuaciones de los chatbots en preguntas de
Annette G Roberts1,2, Reshma Patel1, Sharmilaa Babu1
1Division of Gastroenterology, Hepatology, and Nutrition Duke University Hospital Durham North Carolina USA.
Los chatbots de IA avanzados como ChatGPT-4o y Microsoft Copilot demuestran competencia para aprobar las autoevaluaciones de gastroenterología pediátrica. Estas herramientas de IA muestran una promesa para la preparación y el rendimiento futuros de los exámenes de la junta de gastroenterología pediátrica.
Área de la Ciencia:
- Educación Médica
- Inteligencia Artificial en Medicina
- Gastroenterología Pediátrica
Sus antecedentes:
- Las autoevaluaciones de gastroenterología (GI) del Programa de Revisión y Educación Pediátrica (PREP)® de la Academia Estadounidense de Pediatría (AAP) son cruciales para los gastroenterólogos pediátricos y los residentes que se preparan para los exámenes de subespecialidad.
- Si bien los chatbots de IA han demostrado éxito en los exámenes generales de la junta médica, su rendimiento en los exámenes de la junta de gastroenterología pediátrica especializada sigue sin evaluarse.
Objetivo del estudio:
- Evaluar el rendimiento de Microsoft Copilot, OpenAI ChatGPT-3.5 y ChatGPT-4o en las autoevaluaciones de gastroenterología pediátrica de la AAP PREP® 2022-2024.
- Determinar el potencial de los chatbots de IA actuales para aprobar los exámenes de subespecialidad de gastroenterología pediátrica.
Principales métodos:
- Se utilizaron un total de 216 preguntas de autoevaluación de gastroenterología pediátrica de la AAP PREP® de 2022 a 2024.
- Las preguntas se introdujeron en tres chatbots de IA: Microsoft Copilot, OpenAI ChatGPT-3.5 y ChatGPT-4o.
- El rendimiento se evaluó frente a la puntuación de aprobación establecida (>65%) y se comparó con las puntuaciones de los examinados por primera vez.
Principales resultados:
- OpenAI ChatGPT-4o y Microsoft Copilot obtuvieron puntuaciones superiores al 65% en los tres años de las evaluaciones.
- OpenAI ChatGPT-3.5 aprobó las evaluaciones de 2023 y 2024, pero no la de 2022.
- Los chatbots de IA tuvieron un mejor rendimiento en anatomía, motilidad y trastornos de la boca/esófago, pero mostraron debilidades en fisiología, farmacología y trastornos del hígado/estómago/duodeno.
Conclusiones:
- Los chatbots de IA avanzados, específicamente OpenAI ChatGPT-4o y Microsoft Copilot, demuestran un éxito constante en las autoevaluaciones de gastroenterología pediátrica.
- Estos hallazgos sugieren que los sofisticados chatbots de IA poseen la capacidad de obtener buenos resultados en los exámenes de la junta de gastroenterología pediátrica.
- OpenAI ChatGPT-3.5 mostró limitaciones, lo que pone de relieve la variabilidad en el rendimiento entre los diferentes modelos de IA.
Videos de Conceptos Relacionados
Assessment of the Gastrointestinal System II: Health Perception Pattern
Health Perception Patterns
Health perception patterns offer valuable insights into a patient's lifestyle habits and how they may impact their GI health. These patterns include:
Assessment of the Gastrointestinal System I: Subjective Data
Health History
The initial step in assessing the GI system is obtaining a comprehensive health history. This includes inquiring about the patient's history or presence of problems...
