Video Experimental Relacionado
Updated: Sep 10, 2025

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Evaluación de grandes modelos de lenguaje para la radiología Título y resumen de la revisión sistemática
Siddhant Dogra1, Soroush Arabshahi2, Jason Wei1
1New York University Langone Health. Department of Radiology. New York, NY (S.D., J.W., E.H.).
Los modelos de lenguaje grande (LLM) son prometedores para la revisión sistemática de radiología, pero requieren un diseño rápido y cuidadoso y una supervisión humana para un rendimiento robusto. Su comportamiento en la toma de decisiones y la calibración de la confianza necesitan una evaluación adicional.
Área de la Ciencia:
- La inteligencia artificial en la investigación médica
- Revisiones sistemáticas de radiología
- Aplicaciones de procesamiento de lenguaje natural
Sus antecedentes:
- Las revisiones sistemáticas son cruciales para la síntesis de pruebas en radiología.
- La automatización de la selección de títulos y resúmenes con grandes modelos lingüísticos (LLM) podría mejorar la eficiencia.
- La evaluación del rendimiento, la estabilidad y la toma de decisiones del LLM en este contexto es esencial.
Objetivo del estudio:
- Evaluar el rendimiento, la estabilidad y la toma de decisiones de varios LLM para el cribado de revisión sistemática de radiología.
- Investigar el impacto del encuadre rápido y la calibración de confianza en la precisión del LLM.
- Evaluar la solidez del LLM cuando se enfrenta a desacuerdos y explorar las capacidades de búsqueda autónoma.
Principales métodos:
- Se compararon cinco LLM (GPT-4o, GPT-4o mini, Gemini 1.5 Pro, Gemini 2.0 Flash, Llama 3.3 70B) en dos revisiones sistemáticas de radiología.
- Las tareas incluyeron la clasificación binaria / ternaria, la puntuación de confianza y la reclasificación de desacuerdos.
- La recuperación autónoma de PubMed fue pilotada utilizando las herramientas OpenAI y Gemini Deep Research.
Principales resultados:
- Los LLM demostraron una alta especificidad pero una sensibilidad variable, con puntuaciones F1 que oscilaron entre 0,389 y 0,854.
- La clasificación ternaria arrojó bajas tasas de abstención (< 5%) y ganancias de sensibilidad modestas.
- Los modelos exhibieron sesgo de autoridad, favoreciendo las etiquetas humanas en los desacuerdos, aunque GPT-4o mostró más resistencia.
Conclusiones:
- Los LLM muestran potencial para el cribado de revisión sistemática en radiología.
- La ingeniería cuidadosa y rápida y la supervisión humana en el bucle son fundamentales para una aplicación confiable de LLM.
- Se necesita más investigación para optimizar la integración de LLM y abordar los sesgos en la toma de decisiones.
Más Videos Relacionados
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
Videos de Conceptos Relacionados
Radiological Investigation III: Pulmonary Angiogram and PET Scan
Pulmonary Angiogram
A Pulmonary Angiogram is an invasive procedure involving injecting a contrast medium through a catheter threaded into the pulmonary artery or the right side of the heart to visualize the pulmonary vasculature. Computed Tomography (CT) scans have mainly replaced this...
Radiological Investigation II: MRI and Ventilation Perfusion Scan
Magnetic Resonance Imaging (MRI) and Ventilation Perfusion Scans are two radiological investigations that offer detailed diagnostic images of the body, particularly lung structures.
MRI
MRI uses magnetic fields and radiofrequency signals to distinguish between normal and abnormal tissues. This technology provides a more detailed diagnostic image than CT scans, enabling it to characterize pulmonary nodules, stage bronchogenic carcinoma, and evaluate inflammatory activity in...
Radiological Investigation I: X-ray and CT