${\text{CA}^{2}\text{ST}}$:在音频,空间和时间上的交叉注意力,用于整体视频识别
IEEE transactions on pattern analysis and machine intelligence
|November 4, 2025
概括
音频,空间和时间交叉注意 (CA2ST) 通过整合空间,时间和音频信息来增强视频识别. 这种基于变压器的方法通过协同的专家信息交换实现了平衡和整体的视频理解.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 视频中的动作识别需要理解空间和时间动态.
- 现有的模型往往难以实现平衡的视频内容的时空理解.
研究的目的:
- 为整体视频识别引入一种基于变压器的新方法.
- 开发一个模型,实现平衡的时空理解,并整合视听信息.
主要方法:
- 拟议的空间和时间交叉注意 (CAST),一个双流RGB输入架构.
- 引入了瓶交叉注意 (B-CA) 以实现空间和时间专家之间的协同信息交换.
- 通过整合一个音频专家用于视听识别,扩展了CAST到CAVA.
- 开发了CA2ST,将CAST和CAVA结合起来,用于多专家的交叉注意.
主要成果:
- 在各种视频识别基准 (EPIC-KITCHENS-100,Something-Something-V2,Kinetics-400,ActivityNet,HD-EPIC) 中,CAST表现平衡.
- 在视听动作识别数据集 (UCF-101,VGG-Sound,KineticsSound,EPIC-SOUNDS,HD-EPIC-SOUNDS) 上,CAVA取得了有利的结果.
- B-CA模块有效地促进了多名专家之间的信息交换.
结论:
- 通过有效地整合空间,时间和音频信息,CA2ST提供了一种平衡和整体的视频理解方法.
- 拟议的交叉注意力机制使不同专家模块的协同预测成为可能.


