AdaAlign: 従来型および最新のゼロショットスケッチベース画像検索のための統一ソリューション
Mingrui Zhu1, Fangzhou Wang1, Xin Wei1
1State Key Laboratory of Integrated Services Networks, Xidian University, Xi'an, 710071, China.
まとめ
本研究では、ゼロショットスケッチベース画像検索のための適応およびアライメント(AdaAlign)を導入します。この手法は、ドメイン間の機能を強化し、意味のギャップを橋渡しすることで、画像検索の精度において最先端の結果を達成します。
科学分野:
- コンピュータビジョン
- 機械学習
- 人工知能
背景:
- ゼロショットスケッチベース画像検索(ZS-SBIR)は、スケッチと写真間のドメインの違い、および既知クラスと未知クラス間の意味のギャップにより、課題に直面しています。
- 小規模なビジョンエンコーダーを使用した従来の手法と、最新の大規模ビジョン言語モデル(VLM)には限界があり、ZS-SBIRの課題に効果的に対処する統一されたアプローチはありません。
研究 の 目的:
- 既存のZS-SBIR手法の限界を克服するために、効果的な「適応およびアライメント(AdaAlign)」アプローチを提案すること。
- より汎用性の高い視覚表現のために、ドメイン間の表現を改善し、意味のギャップを橋渡しすること。
主な方法:
- 軽量アダプターまたはLoRAを実装して、抽象的なスケッチ概念を学習し、ドメイン間の表現を強化し、ドメインの異質性を軽減しました。
- 学習した画像埋め込みを、意味的に豊かなテキスト埋め込みに合わせるための蒸留フレームワークを提案し、意味のギャップを橋渡ししました。
- AdaAlignを、従来のスモールモデル(ResNet50、DINO-S)と最新のVLM(SigLIP)の両方に統合しました。
主要な成果:
- AdaAlignをさまざまなモデルに統合することにより、最先端のパフォーマンスを達成しました。
- 3つのベンチマークデータセットでの広範な実験を通じて、検索精度と柔軟性における手法の優位性を示しました。
結論:
- AdaAlignアプローチは、ドメイン間の機能と意味のアライメントを改善することにより、ZS-SBIRの主要な課題に効果的に対処します。
- 提案された手法は、統一された柔軟なソリューションを提供し、さまざまなモデルアーキテクチャ全体で優れたパフォーマンスを達成します。


