以无监督的方式定位图像检索的目标区域
IEEE transactions on neural networks and learning systems
|March 18, 2024
概括
本研究引入了无监督目标区域本地化 (UTRL) 描述符,以改善没有注释数据的图像检索. 这种新的方法提高了本地化准确性和检索性能,优于现有的无监督方法.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 图像检索的监督学习需要大量的注释数据,这是昂贵和不切实际的.
- 准确地定位目标区域对于有效的图像检索至关重要.
- 准确地定位目标区域的无监督方法仍然是一个重大挑战.
研究的目的:
- 提出一种新的无监督图像检索方法,无监督目标区域定位 (UTRL) 描述符,用于在没有手动注释的情况下精确地定位目标.
- 在无监督环境中增强预训练的卷积神经网络 (CNN) 模型的本地化能力.
- 通过实现精确的特征提取和维度减少,提高图像检索系统的整体性能.
主要方法:
- 开发了一种零标签转移学习方法,以提高目标地区的共同本地化,使用预先训练有素的CNN.
- 实施了多尺度注意力积累方法,使用本地高斯权重来提取独特的目标特征.
- 引入了两次PCA-白化 (TPW) 以有效减少矢量维度,最大限度地降低性能退化.
主要成果:
- 拟议的UTRL描述符准确地定位目标区域,而不需要任何监管信息.
- 多尺度注意力机制有效地提取可区分的特征,提高定位精度.
- TPW方法强大降低了特征维度,保持了检索性能.
- 在六个基准数据集中,与最先进的无监督方法相比,平均平均精度 (mAP) 大约提高了7%.
结论:
- UTRL描述符方法提供了一个强大的无监督解决方案,用于在图像检索中准确地定位目标区域.
- 提出的技术,特别是零标签转移学习和TPW,显著提高了无监督图像检索能力.
- 这项工作为开发利用短向量特征和无监督学习的高效图像检索系统铺平了道路.


