Automating expert-level medical reasoning evaluation of large language models.

Shuang Zhou1, Wenya Xie2, Jiaxi Li3

  • 1Division of Computational Health Sciences, Department of Surgery, University of Minnesota, Minneapolis, MN, USA.

NPJ Digital Medicine
|December 6, 2025
PubMed
Summary

A new benchmark, MedThink-Bench, rigorously assesses large language models' (LLMs) medical reasoning. The LLM-w-Rationale framework provides scalable, expert-level evaluation of LLM reasoning quality.