评估用于糖尿病眼部查的商业多式人工智能以及对替代监管途径的影响
Matthew S Hunt1, Tinglong Dai2,3,4, Michael D Abràmoff5,6,7
1Department of Ophthalmology and Visual Sciences. University of Iowa, Iowa City, IA, USA.
NPJ digital medicine
|December 16, 2025
概括
商业生成人工智能模型显示糖尿病眼科检查的诊断准确性有限,低于专家性能和监管标准. 未来的验证可能会使辅助角色成为可能,类似于医生助理.
科学领域:
- 医疗人工智能 医疗人工智能
- 眼科医生 眼科 眼科
- 医疗保健中的机器学习
背景情况:
- 对于糖尿病人眼科检查的自主人工智能得到了验证,但未得到充分利用.
- 商业上可用的现成生成型AI模型 (OTSAI) 正在在没有实际验证的情况下进行测试.
- 在医学推理中,OTSAI显示出前景,引发了对临床使用的兴趣.
研究的目的:
- 评估糖尿病眼科检查的四个领先的OTSAI的诊断性能.
- 将OTSAI性能与人类专家基准和监管标准进行比较.
主要方法:
- 在Messidor-2数据集上评估了四个OTSAI (GPT-4o,GPT-4o-mini,Grok,Gemini).
- 使用3级参考标准进行绩效评估.
- 接收器运营商特征曲线下的面积 (AUC) 是主要的指标.
主要成果:
- GPT-4o获得了最高的AUC (0.83),其次是Grok (0.63).
- 双子座的AUC无法计算.
- OTSAI性能 (最高AUC0.83) 与视网膜专家 (估计AUC0.94) 或FDA终点不匹配.
结论:
- 目前的OTSAI不符合临床专家对糖尿病眼睛检查的性能标准.
- 对OTSAI的潜在监管途径可能涉及对辅助角色的特定任务许可.
- 对安全性和有效性的严格验证对于临床AI部署至关重要,类似于医疗器械和医生助理法规.
更多相关视频
07:41Behavioral Assessment of Visual Function via Optomotor Response and Cognitive Function via Y-Maze in Diabetic Rats
Published on: October 23, 2020
6.6K
10:14Author Spotlight: Ex Vivo OCT-Based Multimodal Imaging of Human Donor Eyes for Research into Age-Related Macular Degeneration
Published on: May 26, 2023
4.1K
