Probabilistic Embeddings With Evidence Learning and Refinement for Text-Video Retrieval

Summary

This study introduces Probabilistic Embeddings with Evidence Learning and Refinement (PE2LR) for improved text-video retrieval. PE2LR enhances cross-modal alignment by modeling video-text pairs as probability distributions, achieving state-of-the-art performance.