Cross-Domain Image Captioning via Cross-Modal Retrieval and Model Adaptation

Summary

This study introduces a novel cross-modal retrieval method to improve cross-domain image captioning. The approach generates pseudo image-sentence pairs for adapting models to new domains with unpaired data, achieving strong performance.