利用空间剩余注意力和时间马尔科夫网络来理解视频动作
Yangyang Xu1, Zengmao Wang2, Xiaoping Zhang3
1School of Computer Science, Wuhan University, Wuhan, 430072, China.
概括
这项研究引入了一种新的双流方法来理解视频动作,利用空间残留注意力和时间马尔科夫网络. 该SRATM方法有效地捕捉空间和时间特征,提高了动作识别的准确性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 对人工智能来说,视频动作理解至关重要,需要对跨的空间和时间特征进行分析.
- 现有的3D卷积神经网络在冗余信息和有效建模时间关系方面扎.
研究的目的:
- 为增强视频动作理解开发一种新的方法.
- 解决现有方法关于空间特征提取和时间关系建模的局限性.
主要方法:
- 提出了一种名为空间剩余注意力和时间马尔科夫 (SRATM) 的双流方法.
- 空间残留注意网络捕获有效的空间特征.
- 时间马尔科夫网络模型使用概率逻辑在之间的时间关系.
主要成果:
- 在四个基准数据集上,SRATM 方法表现出了竞争力的表现:Something-Something-V1,Something-Something-V2,Diving48 和 Mini-Kinetics.
- 这种方法有效地学习互补的空间和时间特征,以改进动作识别.
结论:
- 拟议的SRATM方法通过整合空间注意力和时间建模,为视频动作理解提供了一个有希望的解决方案.
- 这种方法克服了现有方法的局限性,通过减少冗余和增强时间动态的捕捉.


