在基于图像的脑内瘤诊断中评估大型语言模型
Cameron A Rivera1, Vratko Himic1, Nathan T Zwagerman2
1Neurological Surgery, University of Miami Miller School of Medicine, Miami, USA.
Cureus
|December 23, 2025
概括
人工智能 (AI) 模型在解释大脑MRI扫描方面表现有前途,GPT-4o达到70%的准确性,显著改善了GPT-4V. 然而,与神经外科专家相比,这两种AI模型的表现仍然不佳.
科学领域:
- 人工智能的人工智能
- 机器学习 机器学习
- 自然语言处理自然语言处理.
- 医学成像分析 医学成像分析
背景情况:
- 人工智能,特别是大型语言模型 (LLM),正在迅速发展,并准备改变医疗保健.
- 临床医生越来越感兴趣的人工智能工具来解释临床神经影像.
- 这项研究评估了人工智能在神经成像诊断中的表现,与人类专家相比.
研究的目的:
- 将GPT-4V和GPT-4o的诊断性能与神经外科护理人员和实习生进行比较.
- 评估人工智能模型对大脑MRI扫描常见病理的分类准确度.
- 评估AI能力在医学图像解释方面的进步.
主要方法:
- 分析了20个脑部MRI扫描 (质瘤,脑膜瘤,垂体瘤,对照组).
- GPT-4V和GPT-4o的任务是使用相同的提示符来诊断MRI扫描.
- 人工智能性能与14名神经外科主治医生和住院医生的诊断进行了比较.
主要成果:
- 在诊断MRI扫描时,GPT-4V达到40%的准确性,而GPT-4o在诊断MRI扫描时达到70%的准确性.
- 神经外科专家正确诊断了84.6%的病例.
- 与GPT-4V (科恩的卡帕=0.18) 相比,GPT-4o显示出更好的隔离器可靠性 (科恩的卡帕=0.51).
结论:
- 包括GPT-4o在内的AI模型目前在诊断中枢神经系统恶性瘤方面表现不佳,与神经外科专家相比.
- 与GPT-4V相比,GPT-4o显示出显著的改进,这表明人工智能的快速发展.
- 进一步改进人工智能模型可能会提高临床神经成像的实用性,但建议在患者层面使用时谨慎.


