DHVT:用于小数据集识别的动态混合视觉变压器
概括
本研究介绍了动态混合视觉变压器 (DHVT) 和DHVT2,增强视觉变压器 (ViTs) 以更好的图像识别. 这些模型弥合了与卷积神经网络 (CNN) 的性能差距,特别是在有限的数据集上.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 视觉转换器 (ViT) 与卷积神经网络 (CNN) 相比,在有限的数据集上训练时,由于诱导偏差不足,其表现差距较大.
- ViT的主要局限性包括不充分的空间相关性和低于最佳的频道表示,阻碍其捕获细粒度特征和强大的数据模式的能力.
研究的目的:
- 通过提出动态混合视觉变压器 (DHVT) 和其计算效率高的变体DHVT2.2来解决ViT的局限性.
- 为了增强空间特征提取和改善视觉变压器架构中的通道表示.
主要方法:
- DHVT将卷积运算集成到特征嵌入和投影阶段,以加强空间相关性.
- 使用动态聚合机制和新的"头部令牌"来重新校准和协调道表示.
- 该研究探讨了最佳的网络元结构,采用了没有类令牌的多阶段混合设计,通过DHVT2.2中的维数变量残余连接机制进一步细化.
主要成果:
- DHVT和DHVT2在图像识别任务中取得了最先进的结果,有效地缩小了ViT和CNN之间的性能差异.
- 提出的模型在下游实验中显示出强大的概括能力.
结论:
- 动态混合视觉变压器 (DHVT) 和DHVT2成功克服了标准ViT固有的局限性,特别是在数据稀缺的场景中.
- 这些混合架构为推进基于视觉的人工智能提供了有希望的方向,提供了竞争力的性能和增强的概括性.


