Efficient Token-Guided Image-Text Retrieval With Consistent Multimodal Contrastive Training

Summary

This study introduces a unified framework for image-text retrieval, combining coarse- and fine-grained representations. The Token-Guided Dual Transformer (TGDT) architecture improves retrieval accuracy and efficiency.