Compositional Attention Networks with Two-Stream Fusion for Video Question Answering

Summary

We introduce Compositional Attention Networks (CAN), a novel framework for Video Question Answering (VideoQA). CAN utilizes a two-stream fusion approach to enhance video representation and achieve state-of-the-art results on multiple VideoQA benchmarks.