通过伪监督学习利用未标记的视频进行视频文本检索
概括
本研究引入了伪监督选择性对比学习 (PS-SCL) 进行视频文本检索,减少对手册注释的依赖. 通过使用自动生成的伪文本和选择性对比学习,PS-SCL有效地训练模型,提高对基准的性能.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 像CLIP这样的大规模预训练的视觉语言模型在视频文本检索 (VTR) 中表现出色.
- 传统的VTR方法需要昂贵,劳动密集型的手动注释视频-文本对.
- 现有的技术往往在清洁的,注释的数据上直接微调模型,限制了可扩展性.
研究的目的:
- 开发一种新的视频文本检索方法,尽量减少对手动文本注释的依赖.
- 利用未标记的视频数据来训练更高效和可扩展的VTR模型.
- 在监督条件较弱的情况下,加强多模式学习.
主要方法:
- 引入伪监督选择性对比学习 (PS-SCL) 来从未标记的视频数据中生成伪监督.
- 利用CLIP的视觉识别自动生成伪文本,提供弱文本指导.
- 开发了选择性对比学习 (SeLeCT) 来优先选择高度相关的伪监督视频-文本对,以实现有效的多模式学习.
主要成果:
- 在多个视频文本检索基准中,PS-SCL显著优于CLIP的零射击性能.
- 取得了显著的改进,包括MSRVTT上的8.2%R@1,DiDeMo上的12.2%R@1和ActivityNet上的10.9%R@1用于视频到文本的检索.
- 在弱配对场景中证明了伪监督和选择性对比学习的有效性.
结论:
- PS-SCL提供了一个可扩展和有效的替代传统的VTR方法,依赖于广泛的手动注释.
- 提出的方法成功地弥合了视觉内容和文本描述之间的差距,使用弱监督.
- 这项工作推动了视频文本检索领域的发展,通过减少注释成本,实现了强大的多模式学习.


