MedAgentBench v2:LLM

Eric Chen1, Sam Postelnik2, Kameron Black3

  • 1MIT, USA, eric25@alum.mit.edu.

概括

本研究介绍了MedAgentBench,这是评估临床电子健康记录 (EHR) 任务中的大型语言模型 (LLM) 代理人的基准. 改进导致记忆成功率达到98%,展示了AI.