大型语言模型辅助对放射科医生的脑瘤经验水平诊断绩效的影响
Chae Won Song1, Byung Hyun Baek1,2, Seul Kee Kim2,3
1Department of Radiology, Chonnam National University Hospital, Gwangju 61469, Republic of Korea.
Journal of clinical medicine
|February 27, 2026
概括
像ChatGPT-4o和Claude 3.5 Sonnet这样的大型语言模型 (LLM) 在协助脑瘤MRI解释方面表现有前途. 通过LLM辅助,放射学学员的诊断准确性得到了显著提高,突出了他们在临床环境中的潜力.
科学领域:
- 放射学中的人工智能
- 医学成像分析 医学成像分析
- 医疗保健中的机器学习
背景情况:
- 大型语言模型 (LLM) 为增强医学成像诊断能力提供了潜在的工具.
- 在解释像脑瘤这样的复杂病例时,LLM的诊断准确性需要彻底评估.
- 将LLM与人类专家的表现进行比较,对于理解他们在临床工作流程中的作用至关重要.
研究的目的:
- 将ChatGPT-4o和Claude 3.5 Sonnet的诊断准确度与经过董事会认证的放射科医生和脑瘤MRI解释的学员进行比较.
- 评估LLM辅助是否可以提高人类读者的诊断性能.
- 根据结构化成像报告评估LLM的差异诊断能力.
主要方法:
- 分析了127个经组织学证实的大脑瘤病例.
- 两个LLM处理了MRI图像与结构化报告;放射科医生和实习生审查了图像与基本的人口统计数据.
- 产生了差异诊断,并在LLM协助之前和之后计算了准确性.
主要成果:
- 克劳德3.5索内特 (50.4%主要,85.0%前三名) 和ChatGPT-4o (44.9%主要,82.7%前三名) 的LLM表现相似.
- 放射科医生在初级诊断方面表现优于LLM (69.3%),但在前三位差异 (80.7%) 中匹配.
- 通过LLM的帮助,放射科医生的前三分差精度 (80.7%至90.2%) 和实习生的前三分差精度 (48.0%至58.8%) 和前三分精度 (62.5%至81.1%) 显著提高.
结论:
- 当提供结构化成像数据时,LLM可以扩展差异诊断考虑.
- 通过LLM的协助,对诊断性能产生了显著的积极影响,特别是对于放射学学员.
- 在更平衡的输入条件和现实的临床工作流程下,需要进一步验证.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.3K
12:50Lesion Explorer: A Video-guided, Standardized Protocol for Accurate and Reliable MRI-derived Volumetrics in Alzheimer's Disease and Normal Elderly
Published on: April 14, 2014
41.0K
