卷积神经网络和视觉变压器模型在皮肤癌分类上的全面比较
Ibrahim Aruk1, Ishak Pacal2, Ahmet Nusret Toprak3
1Department of Software Engineering, Faculty of Engineering, Architecture and Design, Kahramanmaras Istiklal University, 46050, Kahramanmaras, Turkey.
Computational biology and chemistry
|October 15, 2025
概括
与卷积神经网络 (CNN) 相比,视觉变压器 (ViT) 模型显示皮肤癌分类的精度更高,尽管计算成本更高. 需要进一步的研究来优化临床使用的ViT效率.
科学领域:
- 皮肤病学和人工智能研究
- 医学成像分析 医学成像分析
- 计算病理学计算病理学
背景情况:
- 皮肤癌的诊断依赖于及时和准确的识别以获得有效的治疗.
- 像视觉检查这样的传统方法可能是主观的,容易出错.
- 深度学习模型为提高皮肤癌检测准确度提供了有希望的替代方案.
研究的目的:
- 为了比较卷积神经网络 (CNN) 和视觉转换器 (ViT) 模型在皮肤癌分类中的性能.
- 评估各种性能因素,包括参数数量,计算成本和整体效率.
- 确定最有效的深度学习架构,以改善皮肤癌诊断.
主要方法:
- 评估了15个先进的CNN模型和15个ViT模型,包括基于Swin的架构.
- 利用公开可用的HAM10000和ISIC 2019数据集进行模型培训和评估.
- 保持所有评估模型的相同培训条件,以确保公平的比较.
主要成果:
- 比起CNN模型,ViT模型,特别是基于Swin的模型,实现了比CNN模型更高的精度 (0.9212在HAM10000,0.9187在ISIC 2019).
- 由于自我注意力机制,ViT模型在捕捉远程依赖方面表现出卓越的能力.
- 由于简单的卷积运算,CNN模型的计算要求较低.
结论:
- 与CNN相比,ViT模型在皮肤癌分类方面提供了更高的准确性.
- 在ViT的更高准确度和其增加的计算资源需求 (内存,处理时间) 之间存在一个权衡.
- 未来的研究应该专注于提高ViT计算效率或开发用于临床应用的混合模型.
