Video Experimental Relacionado
Updated: Jan 13, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Evaluación de resúmenes de texto médico utilizando métricas de evaluación automática y el enfoque LLM-as-a-judge: un
Yuriy Vasilev1, Irina Raznitsyna1, Anastasia Pamova1,2
1Research and Practical Clinical Center for Diagnostics and Telemedicine Technologies of the Moscow Health Care Department, 127051 Moscow, Russia.
Los modelos de lenguaje grandes (LLM) muestran potencial para resumir registros de salud electrónicos (EHR). Sin embargo, los métodos de control de calidad automatizados, incluido LLM-as-a-judge, tienen dificultades para detectar errores fácticos, lo que requiere la revisión de expertos.
Área de la Ciencia:
- Informática Médica
- Inteligencia Artificial en la Atención Médica
Sus antecedentes:
- Los registros de salud electrónicos (EHR) contienen datos clínicos vitales pero son difíciles de procesar.
- Los modelos de lenguaje grandes (LLM) ofrecen una solución prometedora para resumir datos de EHR para ayudar a los médicos.
- El control de calidad automatizado es esencial para integrar herramientas de resumen de LLM en la práctica clínica.
Objetivo del estudio:
- Evaluar la viabilidad y las limitaciones del control de calidad automatizado para resúmenes médicos generados por LLM.
- Evaluar métricas automáticas y enfoques LLM-as-a-judge sin la participación de expertos.
Principales métodos:
- Seis LLM de código abierto generaron resúmenes a partir de 30 muestras de texto de EHR.
- Los resúmenes se evaluaron utilizando métricas estándar (BLEU, ROUGE, METEOR, BERTScore) y LLM-as-a-judge.
- Los criterios incluyeron relevancia, exhaustividad, redundancia, coherencia, gramática, terminología y detección de alucinaciones.
- Se realizó una evaluación experta utilizando los mismos criterios para la comparación.
Principales resultados:
- Los LLM demuestran un potencial significativo para resumir datos médicos.
- Ni las métricas automáticas ni los jueces LLM detectan de manera confiable errores fácticos o distorsiones semánticas (alucinaciones).
- Se observó una correlación de Pearson de 0.688 entre las puntuaciones de calidad del resumen de LLM y las opiniones de expertos sobre la relevancia.
Conclusiones:
- La automatización completa de la evaluación de calidad de los resúmenes médicos sigue siendo un desafío importante.
- La investigación futura debe priorizar los métodos de detección de alucinaciones y explorar LLM más grandes y especializados para texto médico.
- La integración de la generación aumentada por recuperación (RAG) en arquitecturas LLM-as-a-judge justifica una mayor investigación.
Más Videos Relacionados
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
09:20Cloud-Based Phrase Mining and Analysis of User-Defined Phrase-Category Association in Biomedical Publications
Published on: February 23, 2019