MGTR-MISS:更多的地面真相获取基于多模式交互和语义监督的视频描述
Jiayu Zhang1, Pengjie Tang1, Yunlan Tan1
1Key Laboratory of Electronic Data Control and Evidence Collection in Jiangxi Province, Jinggangshan University, Ji'an 343009, PR China; College of Electronics & Information Engineering, Jinggangshan University, Ji'an 343009, PR China.
概括
本研究介绍了MGTR-MISS,这是一种通过整合视觉和语言信息来生成准确的视频描述的新型模型. 它显著提高了对基准数据集的视频标题性能.
科学领域:
- 人工智能的人工智能
- 计算机视觉 计算机视觉
- 自然语言处理自然语言处理.
背景情况:
- 产生准确的视频描述是具有挑战性的,因为需要有效的多式联络交互.
- 当前的模型往往无法充分调整视觉和语言模式.
研究的目的:
- 提出一种新的模型,MGTR-MISS,用于生成更准确和含义丰富的视频描述.
- 通过有效地整合外部语言知识和改善多式联络对齐来增强视频标题.
主要方法:
- MGTR-MISS使用多模式交互和语义监控.
- 外语知识从训练数据中获取,以丰富语言语义.
- 多式联动交互模块对齐视觉和语言特征,然后是用视觉文本注意力的标题生成器.
主要成果:
- 在MSVD,MSR-VTT和VATEX数据集上,MGTR-MISS的性能优于基线和最先进的方法.
- 在MSVD上获得了111.1的CIDEr分数,在MSR-VTT上获得了55.0的CIDEr分数.
结论:
- 拟议的MGTR-MISS模型在视频描述生成方面表现出卓越的性能.
- 有效的多模式交互和语义监督是提高视频标题准确性和丰富性的关键.


