Expert evaluation of large language models for clinical dialogue summarization

David Fraile Navarro1, Enrico Coiera2, Thomas W Hambly3

  • 1Centre for Health Informatics, Australian Institute of Health Innovation, Macquarie University, Level 6, 75 Talavera Road, North Ryde, Sydney, NSW, 2113, Australia. david.frailenavarro@mq.edu.au.

Scientific Reports
|January 8, 2025
PubMed
Summary

Large language models like ChatGPT show promise in summarizing clinical dialogues, nearing human quality. However, ROUGE metrics may be unreliable for clinical text evaluation.