对人工智能起草的患者门户消息的检索增强防护:错误分类结构和大规模评估
Wenyuan Chen1, Fateme Nateghi Haredasht2, Kameron C Black3
1Stanford Center for Biomedical Informatics Research, Stanford, CA, USA, wenyuanc@stanford.edu.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|February 27, 2026
概括
对患者信息进行大语言模型 (LLM) 响应的评估至关重要. 一个新的检索增强错误检查 (RAEC) 管道提高了检测临床错误的准确性和一致性.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 临床自然语言处理 临床自然语言处理
背景情况:
- 通过电子健康记录 (EHR) 门户的异步患者-临床医生信息传输增加了临床医生的工作量.
- 大型语言模型 (LLM) 有望协助消息响应,但由于潜在的不准确性,需要进行强有力的评估.
- 现有的评估方法可能无法充分捕捉临床沟通的细微差别.
研究的目的:
- 为评估LLM生成的患者信息响应引入临床基础的错误本体学.
- 开发一个检索增强错误检查 (RAEC) 管道,以提高LLM响应评估的质量.
- 使用两级提示架构实现可扩展和可解释的错误检测系统.
主要方法:
- 通过诱导编码和专家判断开发了5个域,59个代码的错误本体.
- 创建了一个RAEC管道,使用语义上相似的历史消息-响应对来改进判断.
- 采用了两个阶段的提示架构与DSPy用于对1500多个患者消息的层次错误检测.
主要成果:
- 该RAEC管道显示了更好的错误识别,特别是临床完整性和工作流的适当性.
- 与基线评估相比,上下文增强的评估显示出更高的一致性 (一致性=50%对33%).
- 在人类验证中,情境增强标签的性能指标 (F1评分) 显著更高 (0.500比0.256).
结论:
- 拟议的临床基础错误本体学和RAEC管道为患者消息传递提供了有效的AI护.
- 检索增强显著提高了LLM响应评估的准确性和可靠性.
- 这种方法支持在临床通信工作流程中安全和可扩展地部署LLM.


