多头注意力基础框架与人类行动识别残余网络
Basheer Al-Tawil1, Magnus Jung1, Thorsten Hempel1
1Neuro-Information Technology, Otto-von-Guericke-University Magdeburg, 39106 Magdeburg, Germany.
Sensors (Basel, Switzerland)
|May 14, 2025
概括
这项研究引入了人类行动识别 (HAR) 的深度学习框架,达到96.60%的准确性. 该高效模型平衡了实时应用程序的性能和速度.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器人技术 机器人技术 机器人技术
背景情况:
- 人类动作识别 (HAR) 对于人机交互和辅助机器人等应用至关重要.
- 传统的HAR方法面临着时间复杂性,类内可变性和类间相似性的挑战,导致不准确.
- 对于现实世界的部署,需要强大的和高效的HAR.
研究的目的:
- 开发一个深度学习框架,以实现高效和强大的人类行动识别.
- 解决传统方法在处理复杂的时间模式和变化的局限性.
- 为了实现实践应用的实时HAR.
主要方法:
- 一个深度学习框架,将空间特征的ResNet-18和时间特征的Bi-LSTM结合起来.
- 整合一个多头注意力机制来优先考虑关键的运动细节.
- 实现基于运动的框架选择,使用光流来提高效率.
主要成果:
- 在UCF-101数据集上获得了96.60%的准确性,超过了最先进的方法.
- 运行在每秒222 (FPS),证明了高的计算效率.
- 在TIAGo移动服务机器人上的现实场景中验证.
结论:
- 拟议的框架为人类行为识别提供了强大而有效的解决方案.
- 该模型有效地捕捉人类行为,减少了框架依赖性,适合实时系统.
- 证明了在辅助机器人和其他现实场景中的实际应用性.


