了解视觉语言模型对医学图像工件的稳定性
Zijie Cheng1, Ariel Yuhan Ong2,3, Siegfried K Wagner2,3
1Department of Medical Physics & Biomedical Engineering, University College London, London, UK. zijie.cheng.23@ucl.ac.uk.
NPJ digital medicine
|November 27, 2025
概括
视觉语言模型 (VLMs) 与包含文物的医疗图像进行斗争. 它们的准确性随着小的图像缺陷而下降,并且它们很难检测到主要的文物,限制了临床使用.
科学领域:
- 人工智能的人工智能
- 医疗成像医学成像
- 计算机视觉 计算机视觉
背景情况:
- 视觉语言模型 (VLMs) 为临床问题解答提供了潜力.
- 对于VLM对医疗图像工件的强度尚不清楚.
研究的目的:
- 评估VLM在带有和没有文物的医疗图像上的性能和稳定性.
- 评估VLM检测含有文物图像的能力.
主要方法:
- 开发了使用大脑MRI,胸部X射线和视网膜图像从四个现实世界数据集的评估基准.
- 在原始图像和五类弱文物图像上测试了VLM性能.
- 评估了VLM在检测具有强烈文物图像方面的能力.
主要成果:
- 在未经改变的图像上,VLMs获得了中等准确度 (MRI为0.645,OCT为0.602,X射线为0.604).
- 精度在弱人工制成品下显著下降 (-3.34%至-10.46%).
- 在VLM中,强烈文物检测率很低 (0.115到0.194).
结论:
- 目前的VLM对于涉及医疗图像与文物相关的任务来说不够强大.
- 非常需要标准化的基准来评估VLM对图像文物的稳定性.
- 未来的VLM开发必须包含对文物有意识的设计和严格的稳定性测试.

