SMAN: Stacked Multimodal Attention Network for Cross-Modal Image-Text Retrieval

Summary

This study introduces a stacked multimodal attention network (SMAN) for improved cross-modal image-text retrieval. The SMAN precisely models fine-grained image-text correlations, enhancing retrieval accuracy.

Related Concept Videos