Automated Metrics for Medical Multi-Document Summarization Disagree with Human Evaluations

Lucy Lu Wang1,2, Yulia Otmakhova3, Jay DeYoung4

  • 1University of Washington.

Proceedings of the Conference. Association for Computational Linguistics. Meeting
|December 4, 2024
PubMed
Summary

Evaluating multi-document summarization (MDS) quality for biomedical literature reviews is challenging. Current automated metrics often fail to align with human assessments, necessitating new evaluation methods.