MSCViT:一个小尺寸的ViT架构,具有用于微小数据集的多尺度自我注意机制
1National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, China; Department of Computer Science, Sichuan University, China.
概括
本研究介绍了MSCViT,这是一个用于有限数据的小型视觉变压器 (ViT) 架构. 通过整合多尺度的注意力和卷积块,MSCViT通过整合多尺度的注意力和卷积块来提高微小数据集的性能,优于标准ViT.
科学领域:
- 计算机视觉 计算机视觉
- 深度学习 (Deep Learning) 是一种深度学习.
- 人工智能的人工智能
背景情况:
- 视觉变压器 (ViT) 模型在远程依赖方面表现出色,但需要大量的数据集.
- 由于对表示能力的数据需求,ViT在小规模 (微小) 数据集上表现低于卷积神经网络 (CNN).
研究的目的:
- 开发一个参数效率高的视觉变压器架构,适合微小的数据集.
- 在没有对大数据集进行预先培训的情况下,在低数据制度中提高ViT性能.
主要方法:
- 引入了一个小尺寸的ViT架构 (MSCViT),具有多尺度的自我注意力和卷积块.
- 集成的波纹卷积用于选择性高频组件提取和局部特征学习.
- 开发了一种轻量级的多头注意力模块,以减少令牌数量和计算负载.
- 用本地特征提取模块取代标准位置编码.
主要成果:
- MSCViT证明了参数效率和适用于微小数据集的适用性.
- 在CIFAR-100上仅使用14.0M参数和2.5GFLOPs,获得了84.68%的准确性.
- 在没有大规模预训练的情况下,在小规模数据集上表现优于原始ViT.
结论:
- 拟议的MSCViT架构有效地解决了标准ViT的数据限制.
- 在资源有限的环境中,MSCViT为应用先进的深度学习模型提供了可行的解决方案.
- 这项工作突出了混合架构的潜力,将注意力和卷积结合起来,以实现高效的特征学习.


