评估神经放射学图像解释视觉语言模型的诊断准确性
Aymen Meddeb1,2,3, Ida Rangus4, Paolo Pagano5
1Department of Neuroradiology, Hôpital Maison-Blanche, CHU Reims, Université Reims-Champagne-Ardenne, Reims, France. aymen.meddeb@charite.de.
NPJ digital medicine
|November 17, 2025
概括
视觉语言模型 (VLMs) 在神经放射学中显示出有限的诊断准确性,表现明显低于专家人类放射学家. 目前的VLM存在诊断错误和治疗延迟的风险,强调需要专家监督.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 放射学 放射学是一门学科.
背景情况:
- 视觉语言模型 (VLM) 是新兴的人工智能工具,在医学图像解释中具有潜在的应用.
- 神经放射学需要高的诊断准确性,以有效的患者管理.
研究的目的:
- 在神经放射学解释中评估领先的商业和开源VLM的诊断性能.
- 为了比较VLM的表现与专家神经放射学家.
- 在这种临床背景下评估VLM的安全性和错误模式.
主要方法:
- 使用了来自Radiopaedia的100个大脑和脊柱病例的数据集.
- 五个VLM (Gemini 2.0,OpenAI o1,Llama 3.2 90b,Qwen 2.5,Grok-2-vision) 进行了测试.这些机器人可以进行测试.
- 在生成差异诊断方面,VLM的表现与专家神经放射学家进行了比较.
主要成果:
- 专家神经放射学家实现了86.2%的准确性.
- 性能最好的VLM实现了35%的准确性,明显低于人类专家.
- 有害的结果,包括治疗延迟,发生在高达45%的病例中.
- 常见的VLM错误包括错误的定位,描述和幻觉.
结论:
- 目前的VLM在神经放射学诊断方面表现出显著的局限性.
- VLM还不是专家神经辐射学家的可靠替代品.
- 专家监督对于减轻与临床实践中VLM使用相关的风险至关重要.


