Shuang Zhou1, Wenya Xie2, Jiaxi Li3

  • 1Division of Computational Health Sciences, Department of Surgery, University of Minnesota, Minneapolis, MN, USA.

NPJ digital medicine
|December 6, 2025
PubMed
概括

一个新的基准,MedThink-Bench,严格评估大型语言模型 (LLM) 的医学推理. 该LLM-w-Rationale框架提供了可扩展的,专家级别的LLM推理质量的评估.