Evaluating clinical AI summaries with large language models as judges

Emma Croxford1, Yanjun Gao2, Elliot First3

  • 1Department of Biostatistics and Medical Informatics, University of Wisconsin, Madison, USA.

NPJ Digital Medicine
|November 5, 2025
PubMed
Summary

Automating the evaluation of AI-generated clinical summaries using a Large Language Model (LLM) approach significantly improves accuracy assessment. This method offers a scalable and efficient alternative to manual review for Electronic Health Records (EHRs).