AgentClinic: a multimodal benchmark for tool-using clinical AI agents

Samuel Schmidgall1, Rojin Ziaei2, Carl Harris3

  • 1Department of Electrical and Computer Engineering, Johns Hopkins University, Baltimore, MD, USA. sschmi46@jhu.edu.

NPJ Digital Medicine
|April 27, 2026
PubMed
Summary

AgentClinic, a new benchmark for evaluating large language models (LLMs) in clinical settings, reveals significant challenges in sequential decision-making. Claude-3.5 agents generally outperform others, but tool utilization varies greatly among LLMs.

Related Concept Videos