LS-VIT:基于长期和短期时间差异的动作识别视觉转换器
Dong Chen1,2,3, Peisong Wu1,3, Mingdong Chen1,3
1College of Physics and Electronic Engineering, Nanning Normal University, Nanning, China.
Frontiers in neurorobotics
|November 15, 2024
概括
本研究介绍了长期和短期时间差异视觉转换器 (LS-VIT),用于高效的3D视频动作识别. 通过在视频中有效捕捉短期和长期的运动细节,LS-VIT模型实现了高精度.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 变压器模型擅长2D视觉,但在3D视频任务中面临计算挑战,例如动作识别.
- 直接将时间转换应用于3D视频数据,由于数据补丁乘法和复杂的自我注意力机制,增加了计算和内存需求.
研究的目的:
- 开发一个高效和精确的3D自我注意模型用于视频动作识别.
- 在3D视频分析中解决变压器模型所带来的计算挑战.
主要方法:
- 介绍了长期和短期时间差异视觉变压器 (LS-VIT).
- 通过对连续的差异进行加权,纳入了短期运动细节.
- 集成了一个模块,用于长期的运动理解,使用运动激发和来自各种细分的时间差异.
主要成果:
- 在多个基准标准上,LS-VIT实现了高识别精度,包括UCF101,HMDB51和Kinetics-400.
- 该模型有效地模拟了视频中的短期和长期运动动态.
结论:
- 在3D视频动作识别方面,LS-VIT表现出强的性能.
- 该模型显示了进一步优化的潜力,以提高实时性能和行动预测能力.


