一个基于关注的交叉模式条件机制,用于文本-视频检索
Wanru Du1,2, Xiaochuan Jing2, Quan Zhu1,2
1China Aerospace Academy of Systems Science and Engineering, Beijing 100048, China.
Mathematical biosciences and engineering : MBE
|December 5, 2023
概括
本研究引入了一种新的文本视频检索跨模式模型,重点关注详细的框架文本对齐. 拟议的方法通过考虑全球主题和具体细节来提高视频理解,从而提高匹配准确度.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 当前的交叉模式检索通常只对齐全球视频和句子特征.
- 视频包含比文本更丰富的信息,需要更细致的匹配.
- 现有的方法可能错过了关键的级细节,这些细节对于准确的文本视频对应至关重要.
研究的目的:
- 开发一个先进的文本视频检索交叉模式模型.
- 通过专注于框架级语义和详细信息来改善匹配.
- 通过文本驱动的特征提取来增强对视频内容的理解.
主要方法:
- 提出了一种利用注意力机制的交叉模式条件特征聚合模型.
- 引入了跨模式的注意力特征聚合模块,以提取以文本语义为指导的相关特征.
- 实现了全球-本地相似性计算模块,用于双细分性匹配 (视频句子和框架词).
主要成果:
- 该模型在四个基准数据集 (MSR-VTT,LSMDC,MSVD,DiDeMo) 上显示出高于最先进的方法的性能.
- 交叉模式的注意力聚合有效地捕获了主要的语义视频信息.
- 全球-本地相似性计算根据主题和细节特征准确匹配文本和视频.
结论:
- 拟议的模型显著提升了文本视频检索能力.
- 基于注意力的特征聚合对于捕捉突出的视频语义是有效的.
- 双颗粒度相似性计算提高了文本和视频匹配的精度.


