基于大内核注意力机制和相对位置自我注意力机制的图像分类模型
Siqi Liu1, Jiangshu Wei1, Gang Liu1
1College of Information Engineering, Sichuan Agricultural University, Ya'an, Sichuan, China.
PeerJ. Computer science
|June 22, 2023
概括
这项研究介绍了一种混合CNN-变压器模型,通过结合全球和本地特征提取来增强图像分类. 新型架构以更少的参数实现高精度,在基准数据集上表现优于现有方法.
科学领域:
- 计算机视觉 计算机视觉
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 变压器在远程特征方面表现出色,但在局部细节方面扎.
- 卷积神经网络 (CNN) 捕捉了局部细节,但缺乏全球背景.
研究的目的:
- 开发一个混合模型,整合CNN和变压器的优势,以改善图像分类.
- 解决捕获本地细节和全球表示的局限性.
主要方法:
- 提出了一种混合CNN-变压器模型,灵感来自视觉注意网络 (VAN) 和CoAtNet.
- 将大型内核注意力 (LKA) 纳入CNN以实现全球特征表示.
- 利用了具有相对位置自我注意力的变压器块,以保存本地特征细节.
主要成果:
- 混合模型在没有额外的培训数据的情况下,在CIFAR-10,CIFAR-100和Birds400数据集上取得了出色的结果.
- 在CIFAR-10上,SE_LKACAT模型只用750万个参数,达到98.01%的Top-1精度.
- 证明了局部特征准确性和高效的长距离特征关系捕获的有效组合.
结论:
- 拟议的混合型号成功地利用了CNN和变压器的互补优势.
- 在图像分类方面实现了最先进的性能,采用了参数有效的架构.


