STMMOT:通过时空记忆网络和多尺度注意力金字塔推进多对象跟踪
Hamza Mukhtar1, Muhammad Usman Ghani Khan1
1Department of Computer Science, University of Engineering and Technology Lahore, G.T. Road, Lahore, 54890, Punjab, Pakistan; Intelligent Criminology Lab, National Center of Artificial Intelligence, AlKhawarizmi Institute of Computer Science, University of Engineering and Technology, GT, Road, Lahore, 54890, Punjab, Pakistan.
概括
本研究介绍了STMMOT,这是一种用于多对象跟踪的新方法,可以在诸如闭塞等具有挑战性的场景中提高性能. STMMOT增强了对象检测和身份链接,优于以前的方法.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器人技术 机器人技术 机器人技术
背景情况:
- 多对象跟踪 (MOT) 对于监控和自动驾驶等应用至关重要.
- 现有的MOT方法与不均的运动,阻塞和出现-再出现的挑战作斗争.
研究的目的:
- 开发一个全面的MOT方法,集成对象检测和身份链接.
- 增强长期对象跟踪能力,特别是在复杂的场景中.
主要方法:
- 介绍了STMMOT,一个端到端可训练的框架,包含四个关键模块:候选提案网络,缩放变量金字塔,时空记忆编码器和解码器.
- 使用视觉转换器编码解码器来生成提案,并使用动态查询嵌入方法来持续更新对象状态.
- 在时空记忆模块中使用基于注意力的聚合器来编码历史对象状态.
主要成果:
- 在MOT17和MOT20数据集上,STMMOT获得了高分,包括IDF1 (79.8,78.4),MOTA (79.3,74.1) 和HOTA (73.2,69.0).
- 与TransMOT相比,显著改善,IDF1增加了4.58%,ID切换减少了高达21.05%.
- 保持低的ID开关数量 (MOT17上的1529,MOT20上的1264).
结论:
- STMMOT为多对象跟踪提供了强大而有效的解决方案,特别是在有遮和非均运动的场景中.
- 拟议的架构成功地将检测和关联结合在一起,消除了对后处理的需求.
- 动态查询嵌入和内存模块有助于优越的长期跟踪性能.


