多模式大语言模型可以通过 Fundus 照片来诊断糖尿病视网膜病吗? 一个定量评估
Jesse A Most1,2, Evan H Walker3, Nehal N Mehta1,3
1Jacobs Retina Center, Shiley Eye Institute, University of California San Diego, La Jolla, California.
Ophthalmology science
|October 1, 2025
概括
四个多式大型语言模型 (MLLMs) 在检测糖尿病视网膜病变 (DR) 中显示了可变的准确性. 虽然一些模型在特定任务中表现良好,但它们的整体诊断性能需要进一步改进以供临床使用.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 糖尿病视网膜病变 (DR) 是导致视力丧失的主要原因.
- 早期发现和分类DR对于有效管理至关重要.
- 人工智能的进步,特别是多式联通大型语言模型 (MLLMs),为自动化图像分析提供了潜力.
研究的目的:
- 评估四种MLLM在检测和分级糖尿病视网膜病变 (DR) 的诊断准确性.
- 评估MLLM使用其图像分析能力对基底图像的性能.
主要方法:
- 一项回顾性研究分析了来自188名糖尿病或糖尿病前期患者的309张超广场 fundus 图像.
- 四个MLLM (ChatGPT-4o,Claude 3.5 Sonnet,Google Gemini 1.5 Pro,Perplexity Llama 3.1 声波/默认) 用不同的提示来进行DR诊断和严重程度分级进行了测试.
- 三名视网膜专家使用ETDRS分类系统确定了基本真相.
主要成果:
- 对于多选项DR识别,Claude和ChatGPT与其他模型相比显示出更高的准确性和灵敏度.
- 在二进制DR分类中,ChatGPT和Perplexity取得了最高的准确性,所有模型都显示出高特异性.
- 对于DR严重程度分级,模型之间没有发现准确度的显著差异,并且所有模型都表现出低灵敏度.
结论:
- MLLMs显示出有前途的协助视网膜图像分析用于DR检测和分级.
- 目前MLLM的诊断性能不符合安全实施的临床标准.
- 进一步的模型培训和错误优化是必要的,以提高MLLM在DR管理中的临床实用性.


