一个混合变压器-CNN框架用于以不确定性为导向的半监督的多类眼病分类,具有增强的解释性
Muhammad Hammad Malik1, Zishuo Wan1, Yingying Ren2
1School of Automation and Electrical Engineering, University of Science and Technology Beijing, Beijing 100083, China.
概括
这项研究引入了一种新的AI模型,用于从眼底图像中对眼睛疾病进行分类,从而实现高精度和可解释性. 该方法增强了早期诊断和治疗,以防止视力丧失.
科学领域:
- 眼科和医学成像学
- 医疗保健中的人工智能
- 深度学习用于疾病分类.
背景情况:
- 从 fundus 图像中准确地分类眼睛疾病,如白内障,糖尿病视网膜病变 (DR) 和绿内障,对于预防视力损失至关重要.
- 现有的深度学习方法面临着大型标记数据集,低效的无标记数据利用和有限的解释能力的挑战,这阻碍了临床应用.
研究的目的:
- 开发一种新的CNN-变压器混合架构,用于增强多类眼病分类.
- 通过创新的半监督学习 (SSL) 改进标记和未标记数据的利用.
- 为了提高模型的可解释性,用于临床验证和信任.
主要方法:
- 一个混合CNN-变压器架构 (ConvNeXt骨干与变压器模块) 使用多头注意力用于空间和远程特征捕获.
- 不确定性引导的MixMatch (UG-MixMatch) SSL框架采用蒙特卡洛 (MC) 脱落用于不确定性量化和伪标签提炼.
- 基于梯度的综合注意力图 (GIAM) 用于可解释的预测,聚合注意力图与自适应的通道智重.
主要成果:
- 通过UG-MixMatch实现了95.27%的分类准确度,并在眼睛成像健康 (OIH) 数据集上通过MC脱落实现了95.51%.
- 证明与基本真相几乎完全一致 (科恩的卡帕得分为93.70).
- 异常的类智能的性能,包括100%的敏感性/特异性DR和高特异性白内障和绿内障,具有强大的AUC值.
结论:
- 拟议的框架有效地解决了数据稀缺问题,并提高了眼睛疾病分类的解释性.
- 混合模型提供了临床相关的性能,为可扩展,可解释和准确的诊断工具提供了一个有希望的步骤.
- GIAM可视化提供了增强的临床解释性,验证模型预测,用于临床决策支持系统 (CDSS) 的潜在用途.
