探索精细的视觉-文本特征对齐与域自适应对象检测的快速调整.
IEEE transactions on cybernetics
|May 19, 2025
概括
本研究介绍了FGPro,这是一个用于域自适应对象检测 (DAOD) 的新框架,通过使用提示调整微调视觉文本特征来增强概括性. 在各种跨域情景中,FGPro显著提高了检测性能.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 域自适应对象检测 (DAOD) 旨在通过减少域偏差来弥合标记源域和未标记目标域之间的差距.
- 预训练的视觉语言模型 (VLMs) 显示了提高探测器通用性的承诺,但由于范式差异,现有的方法在细粒度的跨域特征对齐方面面临挑战.
- 当前的解决方案可能忽略了关键方面,如提示和跨模式交互中的关系推理,从而阻碍了有效的调整.
研究的目的:
- 在DAOD中使用提示调来探索细粒度的视觉文本特征对齐.
- 引入一个新的框架,FGPro,旨在减轻域差异,增强跨域泛化.
- 提高对象探测器适应新,未标记的领域的能力.
主要方法:
- FGPro采用三级框架,重点关注提示级,模型级和规范化策略.
- 在提示级别,可学习的域适应提示符和提示关系编码器被用来捕获符号间的语义关系.
- 在模型层面,双向交叉模式的注意力促进了视觉和文本特征之间的详细交互,并得到了快速指导的跨领域规范化策略,用于分离信息注入.
主要成果:
- 在四个不同的跨领域场景中,FGPro在DAOD中展示了显著的性能改进.
- 具体收益包括+1.0% AP50 在跨天气,+1.2% AP50 在模拟到真实,+1.3% AP50 在跨摄像头,和+2.8% AP50 在工业.
- 这些结果验证了FGPro细粒度对齐方法在捕获域意识信息方面的有效性.
结论:
- 拟议的FGPro框架有效地在源域和目标域之间对准精细的视觉文本特征.
- 通过解决范式差异和利用提示调整,FGPro成功增强了域自适应对象检测.
- 该框架能够捕获域内特定信息,从而带来了显著的性能提升,优于现有方法.


