大型语言模型可以成为冠状动脉计算机断层扫描血管造影报告中的新支持工具吗?
Eren Çamur1, Turay Cesur2, Yasin Celal Güneş3
1Department of Radiology, Ministry of Health Ankara 29 Mayis State Hospital, Ankara, Türkiye.
Clinical imaging
|September 5, 2024
概括
大型语言模型 (LLM) 在使用CAD-RADS 2.0指南的冠状动脉疾病 (CAD) 诊断中表现强. 聊天GPT 4o实现了100%的准确性,突出了LLMs在改善放射性报告和患者护理方面的潜力.
科学领域:
- 医疗成像中的人工智能
- 放射学和诊断工具 放射学和诊断工具
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 具有显著的潜力,可以在放射学中推进自然语言处理,特别是在冠状动脉疾病 (CAD) 诊断方面.
- 之前的研究重点是个别的LLM,但在CAD-RADS 2.0框架内缺乏对比分析.
研究的目的:
- 综合评估和比较多个领先的LLM在理解和应用CAD-RADS 2.0指南方面的表现.
- 评估各种LLM在基于CAD-RADS 2.0.0的多选择题答案中的准确性.
主要方法:
- 进行了一项比较研究,使用30个多项选择题,这些问题是根据CAD-RADS 2.0指南进行的.
- 评估了几种LLM的性能,包括ChatGPT 4,ChatGPT 4o,Claude 3 Opus,Gemini 1.5 Pro,Mistral Large,Meta Llama 3 70B和Perplexity Pro,这些LLM的性能都得到了评估.
主要成果:
- 聊天GPT 4o以100%的准确度显示出最高的准确度,紧随其后的是ChatGPT 4和Claude 3 Opus以96.6%的准确度.
- 其他评估的LLM (Mistral Large,Perplexity Pro,Meta Llama 3 70B,Gemini 1.5 Pro) 的表现强,准确度在90%至93.3%之间.
结论:
- 目前的LLM在解释和应用CAD-RADS 2.0指南方面表现出相当高的熟练程度,这表明它们有可能提高冠状动脉疾病的放射性报告.
- 需要进一步的研究来探索LLM的视觉诊断能力,这对于全面的放射学实践和最佳患者结果至关重要.


