检索增强开放与专有大型语言模型的心脏病学知识评估
Constantine Tarabanis1, Shaan Khurshid2,3,4, Areti Karamanou5
1Cardiology Division, Heart and Vascular Institute, Mass General Brigham, Boston, Massachusetts, United States of America.
PLOS digital health
|March 12, 2026
概括
开放式大型语言模型 (LLM) 在心脏病学问题上表现强,一些模型的表现超过了人类的平均水平. 检索增强生成 (RAG) 进一步提高了性能,特别是对于较小的模型.
科学领域:
- 人工智能在医学中的应用
- 心血管疾病研究研究
- 医疗教育 技术 技术 医学教育
背景情况:
- 大型语言模型 (LLM) 在医疗保健中越来越多地使用,但它们在心脏病学等专业领域的有效性需要彻底评估.
- 评估法学士在董事会式问题上的表现对于了解其在临床决策支持和医学教育方面的潜力至关重要.
研究的目的:
- 评估和比较开放权重和专有LLM在心脏病学委员会样式问题上的表现.
- 将LLM的表现与人类的表现进行基准测试,并评估恢复增强代 (RAG) 的影响.
主要方法:
- 14名LLM (6名开放权重,8名专有权重) 在449个多选项问题上进行了测试,这些问题来自美国心脏病学院自我评估计划 (ACCSAP).
- 检索增强生成 (RAG) 是使用123个指南和教科书文档的知识库来实现的.
- 准确性是用正确回答问题的百分比来衡量的.
主要成果:
- 开放式重量模型DeepSeek R1获得了最高的准确度 (86.9%),超过了专有模型和人类平均水平 (78%).
- GPT 4o (80.9%) 和OpenEvidence (81.3%) 的表现相互可比.
- 所有模型都使用RAG进行了改进,像Mistral Large 2这样的开放式重量型号的性能与GPT 4o等专有型号的性能相似.
结论:
- 开放式重量LLM可以达到与心血管医学专有模型相提并论或超过专有模型的性能,有或没有RAG.
- RAG显著有利于所有模型,特别是较小的开放重量模型,提高了它们在临床应用中的实用性.
- 开放式重量LLM为临床使用提供了一个可行的,透明的,可配置的替代方案,可能以更低的成本.


