基于细粒度特征学习和融合的行人重新识别
1Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen 518055, China.
Sensors (Basel, Switzerland)
|December 17, 2024
概括
本研究介绍了一种多式联运令牌学习和对齐模型 (MTLA),用于改进基于视频的行人重新识别 (Re-ID). MTLA有效地将视觉和步态数据的细粒度特征融合在一起,提高了跨摄像头人身识别的准确性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 基于视频的行人重新识别 (Re-ID) 在学习有效的表示方面面临挑战,原因是视频的复杂性,如屏蔽和模糊.
- 现有的多式联络融合方法往往在全球范围内运行,限制了它们捕获细粒度,互补信息的能力.
研究的目的:
- 提出一种新的多式联运令牌学习和对齐模型 (MTLA),用于增强基于视频的行人重新识别.
- 通过学习,对齐和融合来自多种模式的细粒度特征来实现更有效的行人表示.
主要方法:
- MTLA模型包含一个多式特征编码器来提取视觉和步态特征,学习和拒绝细粒度令牌.
- 一个基于令牌的跨模式对齐模块将这些多模式特征在令牌层面对齐,以捕获详细的语义信息.
- 一个关联意识的融合模块通过学习模式间和模式内相关性来整合多模式令牌特征,以实现统一的表示.
主要成果:
- 在三个基准数据集上进行了广泛的实验,证明了拟议的细粒度特征对齐和融合的有效性.
- 与最先进的方法相比,MTLA模型在mAP和Rank-K指标中取得了超过0.4个百分点的改进.
结论:
- 拟议的MTLA模型通过利用细粒度的多式联运特征融合,显著增强了基于视频的行人重新识别.
- 精细的标记级别对齐和相关性意识的融合对于捕获丰富的语义信息和提高Re-ID性能至关重要.


