通过双向关系推理和对齐进行多语言文本到图像人体检索
IEEE transactions on pattern analysis and machine intelligence
|October 10, 2025
概括
这项研究引入了一个多语言文本到图像人检索 (TIPR) 基准和一个新的框架,Bi-IRRA. 双IRRA有效地解决了模式异质性,并加强了跨语言和跨模式的调整,以改善人身识别.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 由于文本描述和图像之间的模式异质性,文本到图像人体检索 (TIPR) 面临挑战.
- 现有的方法往往忽略细粒度差异或需要明确的部分对齐.
- 目前的TIPR系统主要以英语为中心,这限制了它们的全球适用性.
研究的目的:
- 开创一个多语言的TIPR任务,并建立一个全面的基准.
- 开发一个新的框架,Bi-IRRA,以实现有效的跨语言和跨模式调整.
- 克服现有的以英语为中心和以调整为中心的TIPR方法的局限性.
主要方法:
- 为初始翻译利用了大型语言模型,并通过特定领域的知识对其进行了改进,以创建一个多语言的TIPR基准.
- 拟议的双IRRA:一个双向隐性关系推理和调整框架.
- 集成了一种双向隐性关系推理模块,用于增强本地关系建模,以及一个多维的全球对齐模块,以弥合模式差距.
主要成果:
- 在所有开发的多语言TIPR数据集中取得了新的最先进的结果.
- 证明了Bi-IRRA在处理模式异质性和跨语言对齐方面的有效性.
- 在之前的工作中,成功地解决了以英语为中心和不那么细致的对齐策略的局限性.
结论:
- 拟议的多语言TIPR基准和Bi-IRRA框架代表了跨模式检索的重大进步.
- 双IRRA通过隐式推理跨模式和语言的关系,为多语言人身份识别提供了强大的解决方案.
- 这项工作为在多种语言背景下建立更具包容性和有效的个人检索系统铺平了道路.
