TransXNet:使用双动态令牌混合器学习全球和本地动态,用于视觉识别
概括
本研究介绍了一种用于视觉网络的新型双动态令牌混合器 (D-Mixer),通过使输入数据的动态适应来提高性能. 拟议的TransXNet模型在图像分类和密集预测任务中实现了卓越的准确性和效率.
科学领域:
- 计算机视觉 计算机视觉
- 深度学习 (Deep Learning) 是一种深度学习.
- 人工智能的人工智能
背景情况:
- 整合卷曲与变压器的目的是通过感应偏差来改善概括.
- 混合网络中的静态卷曲限制了动态适应,并且具有自我注意的功能融合.
- 这导致当前CNN转换器架构的表现能力不足.
研究的目的:
- 解决混合视觉网络中静态卷曲的局限性.
- 提出一种新的,轻量级的双动态令牌混合器 (D-Mixer),用于增强功能表示.
- 开发一种新的混合CNN转换器骨干TransXNet,以提高性能和效率.
主要方法:
- 引入了一种双动态令牌混合器 (D-Mixer),以输入依赖的方式学习全球和本地动态.
- D-Mixer利用一个高效的全局注意模块和一个依赖输入的深度卷积在分割的特征部分.
- 构建了TransXNet,一种混合CNN-变压器视觉骨干,使用D-Mixer作为基本的构建块.
主要成果:
- TransXNet-T实现了比Swin-T在ImageNet-1K上高出0.3%的top-1精度,计算成本不到一半.
- TransXNet-S和TransXNet-B表现出强大的可扩展性,分别达到83.8%和84.6%的顶级-1精度.
- 该架构在密集的预测任务上显示出优越的概括性,与以较低计算成本的最先进方法相比.
结论:
- 拟议的D-Mixer有效地克服了混合网络中静态卷积的局限性.
- TransXNet提供了高精度,高效率和强大的概括能力的令人信服的平衡.
- D-Mixer方法为设计高效和有效的视觉骨干网络提供了一个有希望的方向.
