相关实验视频
Updated: Jan 18, 2026

09:17
Using Retinal Imaging to Study Dementia
Published on: November 6, 2017
22.2K
视觉语言模型的性能,用于在 fundus 照片上识别光盘胀
Kelvin Zhenghao Li1,2,3, Tuyet Thao Nguyen1,4, Heather E Moss1,5
1Department of Ophthalmology, Stanford University, Palo Alto, CA, United States.
Frontiers in digital health
|September 10, 2025
概括
视觉语言模型 (VLMs) 可以在 fundus 照片中比偶然更好地识别光盘胀,但性能因模型而异. 快速复杂性并没有持续提高诊断准确性,这表明可能需要专门的VLM.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 视觉语言模型 (VLMs) 将图像分析与大语言模型 (LLMs) 集成,为临床诊断提供了比传统图像分类的潜在优势.
- 视视膜医生可以考虑临床背景,这对于解释 fundus 照片和诊断诸如光盘胀等疾病至关重要.
研究的目的:
- 为了比较非专业训练VLMs的诊断性能,在 fundus照片上对光盘胀进行分类.
- 评估不同提示策略对眼睛图像分析的VLM性能的影响.
主要方法:
- 一项诊断测试准确性研究使用了779张正常和295张光盘胀 fundus 图像的开源数据集.
- 五个VLM (Llama 3.2-vision,LLaVA-Med,LLaVA,GPT-4o,DeepSeek-4V) 用五个不同的提示进行了测试,创建了25个提示模型对.
- 使用Youden指数 (YI),F1得分和准确率来衡量性能.
主要成果:
- 有效反应率差异很大 (7.8%100%),中位数为93.6%.
- 诊断性能指标显示出相当大的差异:YI (0.000.231),F1得分 (0.000.716) 和准确度 (27.5%70.5%).
- 具有特定提示的 GPT-4o 实现了最高的性能,而 Llama 3.2-vision 在提示中显示了最佳的平均性能;提示的复杂性并没有始终提高结果.
结论:
- 非经过特殊培训的VLM显示出能够将光盘胀分类在机会水平以上,尽管性能取决于模型.
- 迅速增加的复杂性并没有可靠地提高诊断准确性,这表明当前的通用VLM对此任务的局限性.
- 开发专业特定的VLM可能需要在眼科图像分析中实现更高的性能.

