Video Experimental Relacionado
Updated: Sep 8, 2025

05:47
Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
565
Desempeño de la IA generativa en las tareas de ORL: una revisión sistemática y un metanálisis
Sholem Hack1, Rebecca Attal1, Armin Farzad1
1City St. Georges University London School of Medicine, Program Delivered by University of Nicosia at the Chaim Sheba Medical Center, Ramat Gan, Israel.
Auris, nasus, larynx
|September 5, 2025
Resumen
La IA generativa es prometedora en tareas de educación y comunicación en otorrinolaringología. Sin embargo, su desempeño inconsistente en el razonamiento clínico requiere más investigación para su integración segura en la práctica.
Área de la Ciencia:
- Otorrinolaringología
- Inteligencia artificial
- La informática médica
Sus antecedentes:
- La IA generativa, en particular los grandes modelos de lenguaje (LLM), se explora cada vez más para aplicaciones médicas.
- Evaluar la eficacia de los LLM en campos especializados como la otorrinolaringología es crucial para comprender su potencial y limitaciones.
Objetivo del estudio:
- Evaluar sistemáticamente la precisión del diagnóstico, la utilidad educativa y las capacidades de comunicación de la IA generativa en otorrinolaringología.
- Analizar las variaciones de rendimiento de diferentes versiones de LLM (por ejemplo, GPT-4 vs. GPT-3.5) en tareas relacionadas con la otorrinolaringología.
Principales métodos:
- Se realizó una búsqueda exhaustiva de literatura en las principales bases de datos científicas (PubMed, Embase, Scopus, Web of Science, IEEE Xplore) para estudios publicados entre enero de 2022 y marzo de 2025.
- Los estudios elegibles que evalúan la IA generativa basada en texto en otorrinolaringología se examinaron y evaluaron utilizando las herramientas JBI y QUADAS-2.
- Se realizó un metanálisis de efectos aleatorios sobre los datos de precisión del diagnóstico, con análisis de subgrupos basados en el tipo de tarea y la versión del modelo de IA.
Principales resultados:
- Se incluyeron noventa y un estudios, de los cuales 43 proporcionaron datos cuantitativos de precisión diagnóstica en 59 pares modelo-tarea.
- La precisión diagnóstica combinada para la IA generativa en otorrinolaringología fue del 72,7%, con mayor precisión en tareas educativas (83,0%) y de diagnóstico por imágenes (84,9%) en comparación con el apoyo a la decisión clínica (67,1%).
- GPT-4 demostró un rendimiento superior al GPT-3.5, aunque se observaron problemas como alucinaciones y variabilidad del rendimiento en el razonamiento clínico complejo.
Conclusiones:
- La IA generativa demuestra un fuerte rendimiento en tareas estructuradas de otorrinolaringología, particularmente en educación y comunicación.
- El rendimiento inconsistente actual en el razonamiento clínico limita la aplicación independiente de la IA generativa en la atención al paciente.
- La investigación futura debe priorizar la mitigación de las alucinaciones de IA, el establecimiento de métricas de evaluación estandarizadas y la realización de estudios de validación prospectivos para la integración clínica segura.
