动作CLIP:适应语言图像预训练模型用于视频动作识别
IEEE transactions on neural networks and learning systems
|November 21, 2023
概括
本研究引入了一种新的多式联络学习框架,用于视频动作识别,将其视为视频-文本匹配问题. 这种方法可以实现零射击识别,并改善未见概念的性能.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 自然语言处理自然语言处理.
背景情况:
- 传统的视频动作识别模型受到固定类别预测的限制.
- 这些模型缺乏可转移到具有未见概念的新数据集.
研究的目的:
- 通过多式模式学习提出一种用于视频动作识别的新方法.
- 通过利用标签文本中的语义信息来实现零射击动作识别.
- 开发一个新的"预训练,适应和微调"范式,以提高动作识别.
主要方法:
- 模拟动作识别作为多式联络框架内的视频文本匹配问题.
- 利用标签文本中的语义信息来实现更强大的视频表示.
- 使用大规模网络数据实施"预训练,适应和微调"范式.
- 介绍ActionCLIP作为拟议范式的一个实例.
主要成果:
- 实现了卓越和灵活的零射击/少数射击转移能力.
- 在一般行动认可任务上取得了最佳表现.
- 在使用ViT-B/16骨干的Kinetics-400上获得了83.8%的top-1精度.
结论:
- 拟议的多式模式学习框架显著提高了视频动作识别.
- "预训练,适应和微调"模式为动作识别提供了一种强大的方法.
- 行动CLIP表现出强的表现和优秀的可转移性,用于零射击和少数射击学习.


