MGTR-MISS: More Ground Truth Retrieving based Multimodal Interaction and Semantic Supervision for video description

Jiayu Zhang1, Pengjie Tang1, Yunlan Tan1

  • 1Key Laboratory of Electronic Data Control and Evidence Collection in Jiangxi Province, Jinggangshan University, Ji'an 343009, PR China; College of Electronics & Information Engineering, Jinggangshan University, Ji'an 343009, PR China.

Summary

This study introduces MGTR-MISS, a novel model for generating accurate video descriptions by integrating visual and linguistic information. It significantly improves video captioning performance on benchmark datasets.

Related Concept Videos