使LLM-as-a-Judge:

Yuriy Vasilev1, Irina Raznitsyna1, Anastasia Pamova1,2

  • 1Research and Practical Clinical Center for Diagnostics and Telemedicine Technologies of the Moscow Health Care Department, 127051 Moscow, Russia.

PubMed
概括

大型语言模型 (LLM) 显示出对电子健康记录 (EHR) 总结的希望. 然而,自动化质量控制方法,包括LLM-as-a-judge,难以检测事实上的错误,需要专家审查.