什么使得等级视觉变压器?
IEEE transactions on pattern analysis and machine intelligence
|October 11, 2023
概括
层次视觉转换器 (ViT) 可以使用新的宏观架构实现最高性能. 在ViT中用线性层取代自我注意力表明了强大的图像识别和转移学习能力.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 以窗口为基础的自我注意的层次视觉转换器 (ViT) 实现了最先进的结果,挑战了卷积神经网络 (CNN).
- 目前,自我注意是层次ViT中的空间信息聚合的标准.
研究的目的:
- 为了调查是否自我注意力是必要的,在等级ViTs高绩效.
- 探索不同交叉窗口通信方法的影响.
- 评估空间信息聚合的替代方法.
主要方法:
- 用线性映射层取代自我注意层,以创建跨线性架构.
- 在ImageNet-1K图像识别上评估了TransLinear.
- 评估下游任务的转移学习能力,如对象检测和实例细分.
- 实验了替代内容聚合层和交叉窗口通信策略.
主要成果:
- 在ImageNet-1K图像识别上,TransLinear架构实现了强的性能.
- 在下游密集的预测任务中,TransLinear展示了具有竞争力的转移学习特性.
- 该研究发现,宏观架构,而不是特定的聚合层或通信机制,是层次 ViTs 的性能的主要驱动因素.
结论:
- 层次ViT的宏观架构是其强性能的关键因素,不一定是自我注意.
- 简单的线性层可以有效地取代ViT中的自我注意力,提供具有竞争力的结果.
- 这些发现表明,ViTs的宏观架构对传统的CNN范式构成了重大挑战.


