快速iTPN:整体预训练的变压器金字塔网络与代币迁移
概括
我们介绍了Fast-iTPN,这是一个新的视觉转换器模型,可以最大限度地缩小表示学习和下游任务之间的差距. 这种高效的架构将推断速度加快高达70%,性能损失最小.
科学领域:
- 计算机视觉 计算机视觉
- 深度学习 (Deep Learning) 是一种深度学习.
- 人工智能的人工智能
背景情况:
- 视觉转换器 (ViT) 模型已经显示出很大的希望,但在弥合表现学习和下游任务之间的差距方面经常面临挑战.
- 现有的方法可能会产生显著的计算开销和缓慢的推断速度.
研究的目的:
- 提出一个整体预训练的变压器金字塔网络 (iTPN),共同优化网络骨干和部,以最小化传输间隙.
- 引入Fast-iTPN,这是一个高效的变体,可以减少计算内存并加速推断.
主要方法:
- iTPN使用了ViT上的第一个预训练的特征金字塔和带有掩盖特征建模 (MFM) 的多阶段监督.
- 快速iTPN结合了令牌迁移和令牌收集技术,以减少计算成本和内存开销.
- 该模型在ImageNet-1K,COCO对象检测和ADE20K语义细分基准上进行了评估.
主要成果:
- 在ImageNet-1K上,Fast-iTPN实现了高顶-1精度 (88.75%/89.5%的基础/大).
- 在COCO对象检测和ADE20K语义细分方面,Fast-iTPN显示出具有竞争力的性能 (分别为58.4%/58.8%的盒 AP和57.5%/58.7%的mIoU).
- 推断速度加速了高达70%的速度,性能降低是可以忽略不计的.
结论:
- 快速iTPN为各种下游计算机视觉任务提供了高效和有效的骨干.
- 提出的方法显著提高推断速度,而不会影响准确性.
- 这项工作为现实世界视觉应用提供了强大而实用的解决方案.


