相关实验视频
Updated: Jul 31, 2026

09:44
Methods to Test Visual Attention Online
Published on: February 19, 2015
11.9K
MixFormer:以代混合注意力进行端到端跟踪
概括
MixFormer是一个基于变压器的新型框架,统一了功能提取和目标集成,用于视觉对象跟踪. 这款紧型车型在七个基准中实现了最先进的性能.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 传统的视觉对象跟踪依赖于多阶段的管道.
- 这些管道涉及单独的特征提取,目标信息集成和界限框估计.
- 简化和统一这些流程对于提高效率和绩效至关重要.
研究的目的:
- 介绍MixFormer,一个基于变压器构建的紧的跟踪框架.
- 通过使用新的混合注意力模块 (MAM) 统一特征提取和目标信息集成.
- 调查预培训策略并增强在线跟踪能力.
主要方法:
- 开发了混合注意模块 (MAM),用于同时提取特征和集成目标信息.
- 通过堆叠MAM来构建MixFormer跟踪器,包括分层 (MixCvT) 和非分层 (MixViT) 变体.
- 探索监督,自我监督和蒙面自动编码器 (MAE) 前期培训,引入TrackMAE技术.
- 为高效的多模板在线跟踪设计了一个不对称的注意力模式和得分预测模块.
主要成果:
- 在七个具有挑战性的基准 (LaSOT,TrackingNet,VOT2020,GOT-10k,OTB100,TOTB,UAV123) 上,MixFormer追踪器实现了最先进的性能.
- 在MixViT-L模型中,AUC得分很高:在LaSOT上达到73.3%,在TrackingNet上达到86.1%,在TOTB上达到82.8%.
- 调查并突出了监督与自我监督预训的不同行为.
结论:
- 拟议的MixFormer框架有效地统一了关键的视觉对象跟踪过程.
- 混合注意模块 (MAM) 是一个核心组件,可以同时提取特征和集成目标.
- MixFormer展示了卓越的性能和效率,在视觉对象跟踪中设置了新的基准.

