稀有:检索和排名增强MLLM用于视觉识别

概括

这项研究介绍了RAR,这是一种结合CLIP和多式大型语言模型 (MLLMs) 的新方法,以改善细粒度的视觉识别. 对于广泛而详细的数据集,RAR增强了少数拍摄和零拍摄能力.

相关概念视频