WSVAD-CLIP:使用CLIP进行暂时意识和快速学习,用于弱监督的视频异常检测
Min Li1, Jing Sang1, Yuanyao Lu1
1School of Artificial Intelligence and Computer Science, North China University of Technology, No. 5 Jinyuanzhuang Road, Beijing 100144, China.
Journal of imaging
|October 28, 2025
概括
本研究介绍了WSVAD-CLIP,这是使用CLIP进行弱监督的视频异常检测的框架. 它有效地建模了时间依赖和语义表示,在异常检测和识别方面表现优于现有的方法.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 弱监视视频异常检测 (WSVAD) 在模拟时间依赖和语义表示方面面临挑战,原因是缺少级注释.
- 现有的方法难以应对异常事件的多样性,并弥合视觉和文本信息之间的语义差距.
研究的目的:
- 提出WSVAD-CLIP,这是一个新的框架,利用CLIP对WSVAD的跨模式知识.
- 增强视频异常检测中的时间结构和语义表示的建模.
- 提高视频中异常检测和识别的准确性和通用性.
主要方法:
- 拟议的WSVAD-CLIP框架使用了对比性语言图像预训 (CLIP) 模型.
- 引入了结合轴转换器和轻度图注意网络 (LiteGAT) 的轴图 (AG) 模块,以捕捉时间和空间的相关性.
- 文本提示符机制融合了可学习和知识增强的提示符,通过异常视觉引导文本提示符 (AVGTP) 机制来改进.
主要成果:
- 与现有的方法相比,WSVAD-CLIP在UCF-犯罪和XD-暴力数据集上表现出更高的性能.
- 该框架在粗粒度异常检测方面取得了显著的改进.
- 在细粒度异常识别任务中观察到显著的进步.
结论:
- 在WSVAD中,WSVAD-CLIP有效地弥合了文本和视觉之间的语义差距.
- 拟议的AG模块和AVGTP机制增强了时间依赖和语义表示的建模.
- 该框架在视频异常检测和识别方面表现出强大的有效性和通用性.
