Evaluación de resúmenes de texto médico utilizando métricas de evaluación automática y el enfoque LLM-as-a-judge: un

Yuriy Vasilev1, Irina Raznitsyna1, Anastasia Pamova1,2

  • 1Research and Practical Clinical Center for Diagnostics and Telemedicine Technologies of the Moscow Health Care Department, 127051 Moscow, Russia.

PubMed
Resumen

Los modelos de lenguaje grandes (LLM) muestran potencial para resumir registros de salud electrónicos (EHR). Sin embargo, los métodos de control de calidad automatizados, incluido LLM-as-a-judge, tienen dificultades para detectar errores fácticos, lo que requiere la revisión de expertos.