评估多式大型语言模型的临床实用性,以从视网膜成像中检测与年龄相关的黄斑变性
Jesse A Most1,2, Gillian A Folk2, Evan H Walker3
1Shiley Eye Institute, Jacobs Retina Center, University of California San Diego, La Jolla, CA, USA.
Scientific reports
|September 26, 2025
概括
多模式大语言模型 (MLLMs) 显示出从眼睛图像中检测与年龄相关的黄斑变性 (AMD) 的潜力. 然而,目前的人工智能模型尚未足够可靠,用于AMD诊断和分级的临床使用.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 与年龄相关的黄斑变性 (AMD) 是老年人视力丧失的主要原因.
- 准确及时诊断AMD对于有效管理至关重要.
- 多模式大语言模型 (MLLMs) 是新兴的人工智能工具,在医学诊断中具有潜在的应用.
研究的目的:
- 评估四个领先的MLLM在使用超宽场 fundus图像检测和分级AMD严重性的表现.
- 将这些模型的准确性,灵敏性和特异性与人类专家的分级进行比较.
主要方法:
- 对76名患有不同阶段的AMD的患者 (136只眼睛) 的回顾性分析.
- 视网膜专家使用与年龄相关的眼病研究 (AREDS) 分类对 fundus 图像进行独立分级.
- 提示四个MLLM (ChatGPT-4o,克劳德3.5索内特,谷歌双子 1.5 Pro,困惑声纳大) 带有图像和标准化查询进行AMD评估.
主要成果:
- 在二进制AMD分类中,ChatGPT-4o获得了最高的准确度 (0.824),紧随其后的是Perplexity Sonar Large (0.815).
- 困惑声纳大显示在严重程度分级 (0.463) 的最高准确度,尽管差异不是统计学上显著的.
- 聊天GPT-4o在开放式和多选项诊断任务中表现出色.
结论:
- MLLMs显示出自动化AMD检测和从骨髓图像进行分级的前景.
- 目前的MLLM性能不足以直接临床应用.
- 需要进一步开发和验证,以提高人工智能工具对AMD诊断的可靠性.
更多相关视频
08:54Author Spotlight: Understanding Age-Related Macular Degeneration Pathophysiology with QAF Workflow
Published on: May 26, 2023
2.1K
10:24Detecting Abnormalities in Choroidal Vasculature in a Mouse Model of Age-related Macular Degeneration by Time-course Indocyanine Green Angiography
Published on: February 19, 2014
14.0K
