ALSA: Adversarial Learning of Supervised Attentions for Visual Question Answering.

Summary

This study introduces a novel Visual Question Answering (VQA) model using adversarial learning of supervised attentions (ALSAs). ALSAs effectively integrates human attention priors for improved question-relevant image region focus, enhancing VQA performance.