时间建模与结的视觉语言基础模型用于参数高效的文本和视频检索.
IEEE transactions on neural networks and learning systems
|September 9, 2025
概括
本研究介绍了使用结视觉语言基础模型 (TFVL) 的时间建模,以实现高效的文本视频检索. 通过利用冷模型,TFVL通过使用更少的参数显著提高了性能,超过了当前的方法.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 时间建模对于适应文本-图像基础模型以进行文本-视频检索至关重要.
- 现有的方法通常使用低效,重型可训练模块,如变压器或BiLSTMs.
- 需要有效的时间建模技术,利用预训练的基础模型.
研究的目的:
- 提出一种高效的时间建模方法,用于使用结视觉语言基础模型来检索文本和视频.
- 与现有方法相比,减少可训练参数的数量.
- 为了提高文本视频检索系统的性能.
主要方法:
- 使用冷视觉语言基础模型 (TFVL) 的时间建模利用固定编码器来建模时间动态.
- 文本编码器时代建模 (TextTemp) 使用冷文本编码器将表示解释为"视觉单词".
- 图像编码器时代建模 (ImageTemp) 将令牌视为一个统一的视觉实体,具有结的图像编码器.
主要成果:
- 在基准数据集 (MSR-VTT,DiDeMo,ActivityNet,LSMDC) 上,TFVL实现了显著的性能提升.
- 在MSR-VTT上,TFVL在R@1中显示了3.25%的收益,与完整微调相比,只有0.35%的参数.
- 该方法表现出比最先进的方法具有更少可训练参数的优越性能.
结论:
- 在文本视频检索中,TFVL提供了一种有效且参数效率高的时间建模方法.
- 利用冷基础模型是一个可行的策略,以避免重型可训练模块.
- 拟议的方法为高效和高性能的文本视频检索系统设定了新的标准.

