MedAgentBench v2:改善医学LLM代理设计
Eric Chen1, Sam Postelnik2, Kameron Black3
1MIT, USA, eric25@alum.mit.edu.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|February 27, 2026
概括
本研究介绍了MedAgentBench,这是评估临床电子健康记录 (EHR) 任务中的大型语言模型 (LLM) 代理人的基准. 改进导致记忆成功率达到98%,展示了AI.
科学领域:
- 医疗保健中的人工智能
- 临床信息学 临床信息学
- 自然语言处理 (NLP) 是一种自然语言处理.
背景情况:
- 在临床环境中评估大型语言模型 (LLM) 代理具有挑战性.
- 现有的基准缺乏符合FHIR的电子健康记录 (EHR) 集成.
- 以前的LLM代理人在复杂的临床任务和EHR相互作用中扎.
研究的目的:
- 引入MedAgentBench,这是第一个针对符合FHIR标准的EHR中的临床任务的LLM代理人的第一个基准.
- 为LLM代理提供改进的提示工程,工具设计和内存组件.
- 开发新的临床驱动任务,以评估药物泛化和现实世界的适用性.
主要方法:
- 开发了一个符合FHIR标准的EHR的MedAgentBench.
- 实施了快速工程技术,包括链式思维推理和少数镜头示例.
- 引入了用于EHR交互,输出格式和计算的增强工具,以及一个内存组件.
主要成果:
- 在没有内存的情况下,LLM代理实现了91.0%的成功率,使用GPT-4.1.1.使用内存实现了98.0%的成功率.
- 该药物在没有内存输入的任务上表现得更好,这表明了适应性.
- 与医生合作开发了300个新的多步骤临床任务,以进行全面的评估.
结论:
- 在LLM代理设计的显著改进提高了临床EHR任务的性能.
- 存储器组件和提示工程对于高成功率至关重要.
- 为了在医疗保健中负责任地部署AI,需要进一步开发EHR代理和基准.
相关概念视频
Improving Translational Accuracy
15.3K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
15.3K
Improving Translational Accuracy
3.7K
3.7K

