HDG-CLIP: Hierarchical Dual-Granularity Vision-Semantic Alignment for Open-Vocabulary Multi-Label Image

Summary

This study introduces Hierarchical Dual-Granularity Alignment-CLIP (HDG-CLIP) for Open-Vocabulary Multi-Label Image Classification (OV-MLIC). HDG-CLIP enhances recognition of unseen categories by addressing category coupling and scale variation, achieving state-of-the-art results.

Related Concept Videos