使用 fundus 照片检测和诊断遗传性视网膜疾病的通用视觉语言模型的比较分析
Xiang Meng1,2,3,4, Wendy Meihua Wong1,2,5, Krithi Pushpanathan1,2
1Centre for Innovation & Precision Eye Health, Yong Loo Lin School of Medicine, National University of Singapore, Singapore, Singapore.
Eye (London, England)
|October 7, 2025
概括
GPT-4o和GPT-4V显示出从 fundus 图像中检测遗传性视网膜疾病 (IRD) 的前景,尽管诊断准确性需要改进. 双子座模型在正常图像中扎,突出显示了眼科中需要VLLM的改进.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 遗传性视网膜疾病 (IRD) 带来了诊断方面的挑战.
- 视觉大语言模型 (VLLMs) 提供了分析基金照片的潜力.
- 评估VLLM在IRD检测中的临床适用性至关重要.
研究的目的:
- 评估GPT-4omni,GPT-4V和Gemini在使用 fundus图像检测和诊断IRD方面的表现.
- 为了比较三个VLLM的特征描述,检测和诊断准确度.
- 在IRDs的背景下评估VLLMs的基因推断能力.
主要方法:
- 一项比较研究使用了60个IRD和10个正常的超广场底部图像.
- 三个VLLM (GPT-4omni,GPT-4V,Gemini) 用标准化的提示分析了图像.
- 图像分析被盲目的专家评分员评分,以描述特征,检测和诊断准确度.
主要成果:
- GPT-4omni获得了最高的特征描述质量评分.
- 所有模型都显示出高检测准确度 (≥81.4%),但双子座错误地分类了正常图像.
- 与GPT-4V (50%) 和双子 (60%) 相比,GPT-4omni显示出更高的诊断准确性 (65.7%).
- 所有模型的基因推断精度都很低 (≤20.3%).
结论:
- 通过良好的特征提取,GPT-4omni和GPT-4V显示了IRD检测的潜力.
- 双子座模型在正确识别正常 fundus 图像方面表现出局限性.
- 需要进一步完善VLLM,以提高IRD的诊断准确性和基因推断.


