大型语言模型在干预心脏病学中的表现:ILLUMINATE盲目模型对比研究
Attilio Lauretti1, Iginio Colaiori2, Simone Calcagno3
1Division of Cardiology, Santa Maria Goretti Hospital, Latina, Italy; Cardiology Unit, Department of Emergency and Admission, San Paolo Hospital, Civitavecchia, Italy; Department of Cardiovascular Sciences, Fondazione Policlinico Agostino Gemelli IRCCS, Rome, Italy; Division of Cardiology, Cardiovascular and Thoracic Department, Città della Salute e della Scienza, Turin, Italy; Division of Cardiology, Department of Medical Sciences, University of Turin, Italy; Department of Medical-Surgical Sciences and Biotechnologies, Sapienza University of Rome, Latina, Italy; Maria Cecilia Hospital, GVM Care and Research, Cotignola, Italy; ICOT Marco Pasquali Institute, Cardiovascular Department Latina; Department of Clinical and Molecular Medicine, Sapienza University of Rome, Rome, Italy.
大型语言模型 (LLM) 显示了干预心脏病 (IC) 决策的潜力,但性能不同. 使用互联网搜索或指南的ChatGPT表现出色,而Gemini表现最低,表明需要改进LLM集成.
科学领域:
- 心脏病学 心脏病学
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 为干预心脏病学 (IC) 中复杂的决策提供了潜力.
- 然而,它们在提供临床建议方面的比较有效性尚未得到充分证实.
- 本研究评估和比较了六个LLM对复杂IC病例的建议的质量.
研究的目的:
- 为了比较六种不同的大型语言模型 (LLMs) 在产生干预心脏病学 (IC) 临床建议方面的表现.
- 根据适当性,准确性,相关性,清晰性和临床实用性来评估LLM产生的建议的质量.
主要方法:
- 开发了20种复杂的干预心脏病例 (10种冠状动脉疾病,10种结构性心脏病).
- 评估了六种LLM:ChatGPT (默认,指南集成,支持互联网),Gemini,Mistral 7B和Perplexity AI.
- 五位干预心脏病专家独立评估了匿名的LLM输出,使用0-10级,通过混合线性模型进行统计分析.
主要成果:
- 总体综合评分为7.1,在LLM中表现有显著差异 (P<.001).
- 与互联网搜索 (7.8) 和指南集成 (7.7) 的ChatGPT显著超过了其他模型.
- 双子座的得分最低 (6.3),而默认的ChatGPT,Mistral 7B和Perplexity AI的表现中等 (6.9-7.0).
结论:
- 在干预性心脏病决策支持方面,LLM显示出前景,但目前的效果不足于最佳水平.
- 整合网络搜索和基于指南的知识检索对于最大限度地提高LLM实用性至关重要.
- 需要进一步开发,以提高LLMs在心脏病学中的可靠性和临床适用性.


