一个临床环境模拟器,用于动态AI评估
Luyang Luo1, Sung Eun Kim1,2, Xiaoman Zhang1
1Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA.
Nature medicine
|March 13, 2026
概括
本研究引入了临床环境模拟器 (CES),用于在动态的数字医院环境中评估临床大语言模型 (LLM). 该CES在现实的场景中评估LLM绩效,改善医疗保健决策评估.
科学领域:
- 人工智能在医学中的应用
- 临床信息学 临床信息学
- 医疗保健系统工程 系统工程
背景情况:
- 目前的临床大语言模型 (LLM) 评估使用静态数据集,无法代表现实世界的动态医疗环境.
- 现有的基准没有捕捉到临床决策对患者结果和医院操作的级联影响.
研究的目的:
- 引入临床环境模拟器 (CES),这是一个评估临床LLMs的新框架.
- 评估在动态的数字医院环境中LLM的表现,以模拟级联的医疗保健决策效应.
- 为了能够评估临床LLMs的时间推理,资源意识的决策和操作弹性.
主要方法:
- 开发了一个并行模拟架构,其中包括一个"医院引擎"和一个"患者引擎".
- 医院引擎实时跟踪资源 (病床,工作人员,设备).
- 患者引擎通过现实的电子健康记录接口模拟基于LLM干预的疾病进展和治疗反应.
主要成果:
- 在不断变化的约束下,CES允许对时间推理进行评估.
- 它有助于评估资源意识的决策,平衡个体患者需求与系统能力.
- 该框架允许通过对抗性场景 (如同时发生的紧急情况) 来测试运营弹性.
结论:
- 临床环境模拟器 (CES) 提供了比目前的基准更现实的和更全面的临床LLM的评估.
- CES将评估转向评估LLM作为医疗保健服务的动态,综合组成部分.
- 这一框架对于推动AI在临床环境中安全有效地部署至关重要.


