从视频异常检测到视频异常检索:新的基准和模型
概括
本研究介绍了视频异常检索 (VAR),用于使用文本或音频找到特定的异常视频段. 这种方法比传统的视频异常检测方法提供了更精确的检索.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 目前的视频异常检测 (VAD) 主要集中在事件的分类上,这对于详细的异常表征是不够的.
- 现有的方法在表面的单一标签分类和从长,未修剪的视频中检索特定的异常内容方面扎.
研究的目的:
- 介绍一项新的任务,视频异常检索 (VAR),用于精确检索异常视频内容,使用诸如文本描述和音频等交叉模式查询.
- 通过允许从长,未经修剪的视频中获取可能仅部分相关的视频来解决当前VAD的局限性.
主要方法:
- 开发了两个大规模的VAR基准来进行评估.
- 提出了异常导向对齐网络 (ALAN) 模型,采用异常导向采样以专注于关键视频段.
- 整合了一个高效的借口任务,以增强视频和文本表示之间的细粒度语义关联.
- 利用互补的对齐技术来改善跨模式的内容匹配.
主要成果:
- 开发的基准标准的实验结果突出了VAR任务固有的挑战.
- 拟议的ALAN模型在应对这些挑战和实现有效的检索方面展示了显著的优势.
结论:
- 与传统方法相比,视频异常检索 (VAR) 为识别异常视频内容提供了更实用和详细的方法.
- ALAN模型和VAR基准为未来跨模式视频检索和异常检测研究提供了坚实的基础.
更多相关视频
07:46Author Spotlight: Revolutionizing Remote Surgery with Augmented Reality and Robotics for Enhanced Precision and Accessibility
Published on: August 9, 2024
724
08:13SwarmSight: Real-time Tracking of Insect Antenna Movements and Proboscis Extension Reflex Using a Common Preparation and Conventional Hardware
Published on: December 25, 2017
8.2K
