AdaAlign:一个统一的解决方案,用于传统和现代的零拍摄素描图像检索
Mingrui Zhu1, Fangzhou Wang1, Xin Wei1
1State Key Laboratory of Integrated Services Networks, Xidian University, Xi'an, 710071, China.
概括
本研究介绍了以零拍摄草图为基础的图像检索的适应和对齐 (AdaAlign). 该方法增强了跨领域的能力,弥合了语义差距,在图像检索准确度方面取得了最先进的结果.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 基于零拍摄草图的图像检索 (ZS-SBIR) 面临挑战,原因是草图和照片之间的域差异,以及已知和未知类之间的语义差距.
- 使用小视觉编码器和现代大视觉语言模型 (VLMs) 的传统方法存在局限性,没有统一的方法有效地应对ZS-SBIR挑战.
研究的目的:
- 提出一种有效的"适应与调整 (AdaAlign) "方法,以克服ZS-SBIR中现有方法的局限性.
- 改进跨领域的表现,并弥合语义差距,以实现更具概括性的视觉表现.
主要方法:
- 实现轻量级适配器或LoRA来学习抽象素描概念并增强跨域表示,减轻域异质性.
- 提出了一个蒸框架,以将学习的图像嵌入与语义上更丰富的文本嵌入对齐,弥合语义差距.
- 在传统的小型模型 (ResNet50,DINO-S) 和现代的VLM (SigLIP) 中集成AdaAlign.
主要成果:
- 通过将AdaAlign集成到各种模型中,实现了最先进的性能.
- 通过对三个基准数据集进行广泛的实验,证明了该方法在检索准确性和灵活性方面的优势.
结论:
- 通过改进跨领域能力和语义对齐,AdaAlign方法有效地解决了ZS-SBIR的关键挑战.
- 提出的方法提供了一个统一而灵活的解决方案,在不同的模型架构中实现了卓越的性能.


