对于10个大型语言模型的检索增强生成及其在评估医疗健康时的概括性
Yu He Ke1,2, Liyuan Jin3,4,5, Kabilan Elangovan5
1Department of Anesthesiology, Singapore General Hospital, Singapore, Singapore.
NPJ digital medicine
|April 4, 2025
概括
大型语言模型 (LLM) 与检索增强生成 (RAG) 可以改善外科健康评估. 与人类反应相比,GPT-4 LLM-RAG 模型显示出更高的准确性和一致性.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持 临床决策支持
背景情况:
- 大型语言模型 (LLM) 在医学中显示出潜力,但需要特定领域的知识.
- 检索增强生成 (RAG) 通过整合外部数据源来增强LLM.
- 当前的LLM可能缺乏关键医疗任务所需的准确性和一致性.
研究的目的:
- 评估LLM-RAG模型的准确性,一致性和安全性,以确定外科适应性和手术前指令.
- 用既定的临床指南将LLM-RAG的表现与人类生成的反应进行比较.
- 为了确定最佳的LLM-RAG配置进行手术前评估.
主要方法:
- 测试了10个LLM,包括GPT-3.5,GPT-4,GPT-4o,Gemini,Llama2,Llama3和Claude,这些LLM都进行了测试.
- 模型在14个临床场景中被评估,使用35个本地和23个国际外科手术指南.
- 总共有3234个LLM生成的答案与448个人类生成的答案进行了比较.
主要成果:
- 使用国际指导方针的GPT-4LLM-RAG模型实现了96.4%的准确性,明显超过了人类的反应 (86.6%,p=0.016).
- 该模型在20秒内产生了响应,证明了高效率.
- 与人类表现相比,GPT-4 LLM-RAG没有出现幻觉,并且输出一致性优越.
结论:
- 基于GPT-4的LLM-RAG模型为手术前评估提供了一个高度准确和高效的解决方案.
- 这些模型显示出显著的潜力,以提高手术适应性决定的安全性和一致性.
- 在AI驱动的临床决策支持系统中,LLM-RAG技术代表了一个有前途的进步.


