Evaluating Medical Text Summaries Using Automatic Evaluation Metrics and LLM-as-a-Judge Approach: A Pilot Study

Yuriy Vasilev1, Irina Raznitsyna1, Anastasia Pamova1,2

  • 1Research and Practical Clinical Center for Diagnostics and Telemedicine Technologies of the Moscow Health Care Department, 127051 Moscow, Russia.

PubMed
Summary

Large Language Models (LLMs) show promise for summarizing electronic health records (EHRs). However, automated quality control methods, including LLM-as-a-judge, struggle to detect factual errors, necessitating expert review.

Related Concept Videos