Video Experimental Relacionado
Updated: Sep 9, 2025

A Novel Method for Involving Women of Color at High Risk for Preterm Birth in Research Priority Setting
Published on: January 12, 2018
Qué tan bien se desempeñan ChatGPT y Claude en la selección de estudios para la revisión sistemática en obstetricia
Suppachai Insuk1, Kansak Boonpattharatthiti2,3, Chimbun Booncharoen1
1Faculty of Pharmaceutical Sciences, Naresuan University, Phitsanulok, Thailand.
Los modelos de IA generativa como ChatGPT y Claude son prometedores en la selección de estudios de revisión sistemática. Si bien los investigadores humanos obtuvieron un rendimiento ligeramente mejor en la evaluación inicial, la IA demostró un gran potencial, especialmente en la revisión de texto completo, acercándose al rendimiento a nivel humano.
Área de la Ciencia:
- La informática médica
- Inteligencia artificial en el cuidado de la salud
- La medicina basada en la evidencia
Sus antecedentes:
- La IA generativa se explora cada vez más para la eficiencia de la revisión sistemática.
- Las pruebas actuales sobre el rendimiento de detección de IA no son concluyentes.
- Existen comparaciones directas limitadas entre diferentes modelos de IA.
Objetivo del estudio:
- Evaluar el ChatGPT-4o y el Claude 3.5 Sonnet en la selección de estudios de revisión sistemática en obstetricia.
- Para comparar el rendimiento de la IA con los investigadores humanos.
Principales métodos:
- La búsqueda sistemática de la literatura (PubMed, EMBASE, Cochrane CENTRAL, Disertaciones abiertas de EBSCO) es una de las principales herramientas de búsqueda de trabajos.
- Evaluación del título/resumen utilizando un enfoque basado en indicaciones que compara a los investigadores de IA y jóvenes con un investigador experimentado.
- Revisión del texto completo utilizando estrategias rápidas cortas y largas para la IA.
- Métricas de rendimiento: exactitud, sensibilidad, precisión, puntaje F1, valor predictivo negativo (VAN).
Principales resultados:
- Título / resumen de detección: Los investigadores humanos tuvieron la mayor precisión (0,9593) y puntuación F1 (0,3853), seguidos por Claude y ChatGPT. Todos mostraron un alto VAN.
- Cribado de texto completo: ChatGPT con un breve aviso logró la mayor precisión (0.904), puntuación F1 (0.90) y VAN (1.00), superando a Claude y a los investigadores humanos.
Conclusiones:
- Los modelos de IA generativa demuestran un rendimiento cercano al nivel humano en la selección de estudios de revisión sistemática.
- La IA muestra un potencial significativo, en particular en las etapas de revisión del texto completo.
- Se recomienda una mayor investigación para la integración de la IA en la síntesis de evidencia en varios campos.
Más Videos Relacionados
09:03Semiconductor Sequencing for Preimplantation Genetic Testing for Aneuploidy
Published on: August 25, 2019
09:51Model Surgical Training: Skills Acquisition in Fetoscopic Laser Photocoagulation of Monochorionic Diamniotic Twin Placenta Using Realistic Simulators
Published on: March 21, 2018
Videos de Conceptos Relacionados
Clinical Trials: Overview
Study Design in Statistics
Does aspirin reduce the risk of heart attacks? Is one brand of fertilizer more effective at growing roses than another? Is fatigue as dangerous to a driver as the influence of alcohol? Questions like these are answered using randomized experiments with proper...
Comparing the Survival Analysis of Two or More Groups
Types of Biopharmaceutical Studies: Controlled and Non-Controlled Approaches
Non-controlled studies, commonly employed for initial exploration, lack a control group, rendering them susceptible to biases and external influences. In contrast,...
Clinical Trials
There are four phases in a clinical trial. A phase one...
Gonadal and Placental Hormones
In males, testosterone is the primary gonadal androgen. It plays a central role in the maturation of male reproductive organs — the penis and testes. Additionally, testosterone is instrumental in the development of secondary sexual characteristics — a deep voice as well as facial and pubic hair...