HTC-retina:一种混合的视网膜疾病分类模型,使用从光学连贯断层扫描图像的变压器-卷积神经网络来进行分类
Ayoub Laouarem1, Chafia Kara-Mohamed1, El-Bay Bourennane2
1Department of Computer Science, University of Ferhat Abbas 1, Setif, Algeria.
Computers in biology and medicine
|June 15, 2024
概括
这项研究引入了一种混合卷积神经网络 (CNN) -视觉变压器 (ViT) 模型,用于从光学连贯断层扫描 (OCT) 图像中诊断七种视网膜疾病,实现高精度和效率.
科学领域:
- 眼科医生 眼科 眼科
- 医疗成像医学成像
- 人工智能的人工智能
背景情况:
- 视网膜疾病带来了重大的公共卫生挑战,需要先进的计算机辅助诊断工具.
- 从光学一致性断层扫描 (OCT) 图像中准确分类视网膜疾病对于及时干预至关重要.
研究的目的:
- 开发和评估一种混合卷积神经网络 (CNN) -视觉转换器 (ViT) 模型,用于七种视网膜疾病的多标签分类.
- 为了利用CNN和ViT的互补优势,进行增强的医学图像分析.
主要方法:
- 提出了一个混合模型,将一个卷积补丁和令牌嵌入 (CPTE) 模块与一个残余深度-点向 ConvNet (RDP-ConvNet) 集成.
- 该CPTE模块结合了感应偏差,并解决了ViTs的低级特征提取.
- RDP-ConvNet 模块专注于使用剩余架构中的深度和点向卷曲来进行高级特征提取.
主要成果:
- 在三个数据集 (OCT-2017,OCT-C8,OCT-2014) 上,HTC-Retina模型实现了高性能.
- 准确率分别达到了99.40%,97.00%和99.77%.
- 灵敏率分别为99.41%,97.00%和99.77%,在计算效率上表现出比现有模型更高的性能.
结论:
- 混合CNN-ViT模型有效地从OCT图像中分类多种视网膜疾病.
- 结合CNN和ViT,为医学图像分类提供了强大而高效的方法.
- 拟议的模型显示了在眼科中推进计算机辅助诊断的巨大潜力.


