以文本为导向的图像恢复和语义增强用于文本到图像的人员检索
Delong Liu1, Haiwen Li1, Zhicheng Zhao2
1School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, 100876, China.
概括
这项研究引入了一个新的文本到图像人体检索 (TIPR) 框架,该框架增强了图像-文本对齐,以更好地识别人. 该方法通过关注细粒度交互和语义对应,提高了检索准确度.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 文字对图像人体检索 (TIPR) 旨在从文本描述中找到特定的人物图像.
- 一个关键的挑战是视觉和文本数据之间的表示差距.
- 现有的方法很难有效地构建文本和图像之间的语义对应.
研究的目的:
- 提出一个新的TIPR框架,用于细粒度的交互和个人图像和文本之间的对齐.
- 弥合模式差距,提高人员检索系统的准确性.
主要方法:
- 微调一个对比的语言图像预训练 (CLIP) 模型,以创建一个视觉文本双编码器.
- 引入一个以文本为导向的图像恢复 (TIR) 任务,用于将文本实体映射到图像区域.
- 使用跨模式的三重损失来处理硬样本并提高可区分性.
- 实施基于修剪的文本数据增强方法,以专注于基本的描述元素.
主要成果:
- 拟议的方法在三个基准数据集上显著优于最先进的方法.
- 在本地文本和视觉嵌入之间展示了更好的对齐.
- 提升了对人形图像微妙差异的模型可辨别性.
结论:
- 新的TIPR框架有效地解决了跨模式检索的挑战.
- 提出的技术在基于文本描述的获取人形图像方面带来了卓越的性能.
- 该框架为推进人员检索技术提供了一个有希望的方向.


