零拍摄视频接地使用伪查询查找和验证
概括
本研究引入了一个新的零拍摄视频接地 (ZS-VG) 框架,Lookup-and-Verification (LoVe),以改善视频理解. 使用自然语言查询,没有大量的手动注释,LoVe有效地识别了视频时刻.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 视频接地,从文本查询中识别视频段,对于视频理解至关重要.
- 完全监督的方法需要大量的数据,阻碍了可扩展性.
- 现有的零拍摄视频接地 (ZS-VG) 方法与各种类别和上下文动态作斗争.
研究的目的:
- 为了解决当前ZS-VG方法的局限性.
- 开发一个新的框架,以实现高效,准确的零拍摄视频接地.
- 提高视频中不同类别和上下文交互的识别.
主要方法:
- 引入了一个名为Lookup-and-Verification (LoVe) 的两阶段零拍摄视频接地 (ZS-VG) 框架.
- 将伪查询生成视为视频到概念检索问题.
- 实施了验证过程,以确保检索到的概念与视频内容保持一致.
主要成果:
- 在零拍摄视频接地方面,LoVe框架证明了其有效性.
- 在诸如Charades-STA,ActivityNet-Captions和DiDeMo.等基准数据集上取得了强的表现.
- 展示了识别不同类别和捕捉视频动态的能力.
结论:
- LoVe框架为零拍摄视频接地提供了一个有前途的解决方案.
- 拟议的方法通过克服现有方法的局限性来增强视频理解.
- 对于视频时刻检索,LoVe提供了一个可扩展和有效的方法.


