在医学图像分类中调查视觉变压器对标签噪声的稳定性
概括
视觉转换器 (ViT) 与CNN相比,在医学图像分类中显示出与标签噪声相比有希望的稳定性. 对于ViT模型来说,预训是必不可少的,以便在杂的数据集上实现卓越的性能.
科学领域:
- 用于医学图像分析的深度学习.
- 计算机视觉在医疗保健中的应用
- 人工智能模型的稳定性 人工智能模型的稳定性
背景情况:
- 医疗数据集中的标签噪声降低了深度学习模型的性能.
- 卷积神经网络 (CNN) 已经成为医学图像分类的标准.
- 视觉转换器 (ViT) 提供了改进特征学习的潜力,特别是在大型数据集.
研究的目的:
- 在医学图像分类中调查视觉变压器 (ViT) 对标签噪声的架构稳定性.
- 在不同的标签噪声条件下,比较基于ViT的模型与基于CNN的模型的性能.
- 为了确定预训练对ViT标记噪声的强度的影响.
主要方法:
- 使用了两个医学图像分类数据集:COVID-DU-Ex和NCT-CRC-HE-100K.
- 在数据集中注入不同速率的标签噪声,以模拟现实世界的缺陷.
- 在这些杂的数据集上评估和比较ViT和CNN架构的性能.
- 研究了预训练策略对ViT模型强度的影响.
主要成果:
- 与CNN相比,视觉变压器 (ViT) 展示了与标签噪声相比的增强架构稳定性.
- 对于这两种架构来说,随着标签噪声率的增加,模型性能下降,但ViTs显示出更好的弹性.
- 在杂的监督医疗图像数据集上训练时,预训练显著提高了ViT模型的稳定性.
结论:
- 视觉转换器 (ViT) 为受标签噪声影响的医疗图像分类任务提供了比CNN更强大的替代方案.
- 预训练是最大限度地发挥ViT架构在处理杂的医学成像数据方面的好处的关键因素.
- 未来的研究应该探索ViT在其他具有挑战性的医疗AI应用中的潜力.


