Auditing frontier general-purpose large language models in biomedical tasks: reasoning gains, extraction limits, and

Yu Hou1, Zaifu Zhan2, Min Zeng1

  • 1Division of Computational Health Sciences, University of Minnesota, Minneapolis, Minnesota, USA.

Research Square
|February 27, 2026
PubMed
Summary

Large language models show improved clinical reasoning and multimodal question-answering, but struggle with specific tasks. Current benchmarks may overestimate capabilities, necessitating careful human-in-the-loop evaluation for safe clinical deployment.