Video Experimental Relacionado
Updated: May 12, 2026

Inverse Probability of Treatment Weighting Propensity Score using the Military Health System Data Repository and National Death Index
Published on: January 8, 2020
El riesgo de sesgo de los autores de Cochrane y ChatGPT frente a la inteligencia artificial
1Cochrane Evidence Synthesis Unit Germany/UK, Institut für Allgemeinmedizin (ifam), Universitätsklinikum Düsseldorf Heinrich-Heine-Universität Düsseldorf Germany.
ChatGPT-4o muestra un acuerdo moderado con los revisores humanos para evaluar el riesgo de sesgo en ensayos controlados aleatorios (ECA). Si bien la IA es prometedora para la síntesis de evidencia, se necesita un mayor refinamiento para un rendimiento óptimo en las revisiones sistemáticas.
Área de la Ciencia:
- La informática médica
- Inteligencia artificial en el cuidado de la salud
- Síntesis de las pruebas
Sus antecedentes:
- Las revisiones sistemáticas y los metanálisis son cruciales para la toma de decisiones clínicas, pero requieren mucho tiempo.
- La inteligencia artificial (IA) ofrece el potencial para acelerar los procesos de síntesis de pruebas.
- La evaluación del riesgo de sesgo es un componente fundamental de las revisiones sistemáticas.
Objetivo del estudio:
- Evaluar el rendimiento de ChatGPT-4o en la evaluación del riesgo de sesgo para ensayos controlados aleatorios (ECA) utilizando la herramienta de riesgo de sesgo 2 (RoB 2).
- Comparar las evaluaciones del riesgo de sesgo impulsadas por la IA con las realizadas por los revisores humanos en las revisiones Cochrane.
- Cuantificar el acuerdo y la precisión de ChatGPT-4o en las evaluaciones de RoB 2.
Principales métodos:
- Se seleccionó una muestra de revisiones Cochrane utilizando la herramienta RoB 2.
- ChatGPT-4o fue impulsado a evaluar el riesgo de sesgo para ECA basados en dominios RoB 2.
- El acuerdo se midió utilizando estadísticas de kappa ponderadas, junto con la precisión, sensibilidad y especificidad.
Principales resultados:
- ChatGPT-4o logró un acuerdo moderado (kappa ponderado = 0, 51) con los revisores humanos para el riesgo general de juicios sesgados.
- El acuerdo varió según el dominio, desde justo (selección de los resultados informados) hasta moderado (medida de los resultados).
- La IA demostró una sensibilidad del 53% para los estudios de alto riesgo y una especificidad del 99% para los estudios de bajo riesgo.
Conclusiones:
- ChatGPT-4o demuestra una capacidad razonable a moderada en la realización de evaluaciones de riesgo de sesgo utilizando la herramienta RoB 2.
- La evaluación del riesgo de sesgo asistida por IA muestra potencial, pero requiere un mayor desarrollo e ingeniería rápida.
- La investigación futura debe centrarse en las indicaciones estandarizadas y la fiabilidad de los interraters para comparaciones más sólidas.
Videos de Conceptos Relacionados
Improving Translational Accuracy
Improving Translational Accuracy
Random and Systematic Errors
Systematic Error: Methodological and Sampling Errors
Sampling errors originate from improper sampling methods or the wrong sample population. These errors can be minimized by refining the sampling strategy. Defective instruments or faulty calibrations are the sources of instrumental...
Random and Systematic Errors
Accuracy and Errors in Hypothesis Testing
In hypothesis testing, the probability of making a Type I error, denoted as α, is commonly set at 0.05. This significance level indicates a 5% chance...

