热图聚合网络用于从RGB视频中识别动作
IEEE transactions on pattern analysis and machine intelligence
|December 5, 2025
概括
本研究介绍了HP-Net,这是一个用于视频中人为动作识别 (HAR) 的新型热图聚合网络. 惠普-Net提取了强大的功能,优于现有方法,并允许更准确的行动识别.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 在视频中,人为动作识别 (HAR) 是至关重要的,但在RGB数据方面面临着挑战,包括冗余,噪音和高存储成本.
- 现有的深度特征提取方法很难有效地利用视频中的丰富信息.
研究的目的:
- 提出一种新的热图聚合网络 (HP-Net),用于在人类行动识别中进行强大而简洁的特征提取.
- 通过将提取的特征与多式联运数据集成,提高动作识别的准确性.
主要方法:
- 开发了一个热图聚合网络 (HP-Net) 与反聚合模块,用于信息丰富,强大和简洁的人体特征提取.
- 设计了空间运动共同学习和文本改进调制模块,用于多式联运数据集成.
主要成果:
- 从HP-Net中提取的聚合特征显示出与传统的姿势和热图特征相比,显著的性能优势.
- 在多个基准数据集 (NTU RGB+D 60/120,Toyota-Smarthome,UAV-Human) 中,HP-Net的性能始终优于现有的人类行动识别方法.
结论:
- 通过提供卓越的特征提取和集成能力,HP-Net有效地解决了现有 HAR 方法的局限性.
- 拟议的方法为视频中的人类行为识别提供了更强大,更有效的解决方案.

