Video Experimental Relacionado
Updated: Sep 10, 2025

03:14
Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
681
Detección de calidad del informe CTA de cabeza y cuello inteligente con modelos de lenguaje grandes
Liping Tian1,2, Yao Lu1,2, Xiaolu Fei3
1Department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University, Beijing, 100053, China.
Journal of imaging informatics in medicine
|August 27, 2025
Resumen
Los modelos de lenguaje grande (LLM) como GPT-4 pueden detectar con precisión errores en los informes de angiografía CT de cabeza y cuello (CTA), mejorando significativamente la eficiencia del control de calidad de la radiología.
Área de la Ciencia:
- Radiología
- Inteligencia artificial
- La informática médica
Sus antecedentes:
- El control de calidad de los informes radiológicos es crucial para la seguridad del paciente y el diagnóstico eficaz.
- La automatización de la detección de errores en los informes radiológicos puede mejorar la eficiencia y la precisión.
- Los modelos de lenguaje grande (LLM) son prometedores en el análisis de textos médicos.
Objetivo del estudio:
- Evaluar el rendimiento de GPT-4, ERNIE Bot y SparkDesk en la identificación de errores comunes en los informes de angiografía computarizada de cabeza y cuello (CTA).
- Evaluar el potencial de los LLM para apoyar los procesos de control de calidad de los informes radiológicos chinos.
- Comparar la eficiencia y la precisión de los LLM con la revisión manual para la evaluación de la calidad de los informes.
Principales métodos:
- Recogí 15.000 informes de CTA de la cabeza y el cuello de dos conjuntos de datos.
- Se han identificado seis tipos de errores comunes y se han desarrollado métodos de detección basados en el LLM.
- Evaluación de la calidad del informe mediante una escala de Likert de 5 puntos y pruebas estadísticas (Wilcoxon rank-sum, Friedman, ICC, ANOVA).
- Evalúa el rendimiento del modelo utilizando la precisión, el recuerdo y la puntuación F1.
Principales resultados:
- Los LLM lograron una precisión de detección de más del 95% para seis tipos de errores comunes en el conjunto de datos 2.
- Las tasas de detección de errores fueron menores en los informes finales en comparación con los informes preliminares.
- GPT-4 demostró una consistencia moderada con las puntuaciones manuales (ICC=0,517), mientras que ERNIE Bot y SparkDesk mostraron una consistencia ligeramente menor.
- Los LLM evaluaron los informes significativamente más rápido que los revisores humanos.
Conclusiones:
- Los LLM pueden identificar eficazmente los tipos de error y diferenciar la calidad del informe en los informes de CTA de cabeza y cuello.
- Estos modelos ofrecen una mejora significativa en la eficiencia de las revisiones de control de calidad.
- Los LLM tienen un importante valor de investigación y práctico para mejorar la garantía de calidad de los informes radiológicos.

