开发和评估一个检索增强型大代语言模型虚拟助理的开发和评估,用于术后指令
Syed Ali Haider1, Srinivasagam Prabha1, Cesar Abraham Gomez Cabello1
1Division of Plastic Surgery, Mayo Clinic, Jacksonville, FL 32224, USA.
Bioengineering (Basel, Switzerland)
|November 27, 2025
概括
人工智能虚拟助理 (AIVA) 平台通过提供准确,安全和相关的患者指导来增强术后恢复. 这种人工智能系统结合了NLP和LLM,以解决信息差距并减少医疗保健的过度利用.
科学领域:
- 医疗保健中的人工智能
- 自然语言处理自然语言处理.
- 大型语言模型
背景情况:
- 术后恢复受到患者信息缺口的阻碍,导致提供者负担和医疗保健过度利用.
- 传统的排出材料往往是无效的,导致患者的压倒和不必要的急救访问.
- 现有的对话式人工智能,包括自然语言处理 (NLP) 和大型语言模型 (LLM),在准确性和安全性方面面临限制.
研究的目的:
- 开发AI虚拟助理 (AIVA) 平台,整合NLP和LLM进行动态的术后指导.
- 使用Retrieval-augmented generation (RAG) 架构与Gemini 2.0 Flash以及经过验证的医学知识库.
- 提供安全,面向患者的术后信息,以验证的临床内容为基础.
主要方法:
- 在20个康复领域使用750个模拟患者互动来评估AIVA平台.
- 医生审查员评估了系统性能,包括分类指标,相关性,完整性和一致性.
- 自动化指标评估了接地性,流性和可读性,而安全护则在范围外和紧急情况下进行了测试.
主要成果:
- 该系统实现了98.4%的分类准确度,具有高医生评级的完整性 (4.83/5) 和相关性 (SSI指数2.68/3).
- 安全护成功识别了100%的超出范围和升级场景.
- 地理性评估显示出强大的精度 (0.951) 和忠实度 (0.956),验证一致率为95.6%.
结论:
- 模拟测试证实了AIVA平台的技术准确性,安全性和术后护理的临床相关性.
- 该RAG架构有效地平衡了LLMs的灵活性与确定性NLP的安全性.
- 结果支持为临床试验做好准备,可读性被确定为未来改进的领域.

