从外部到内部:为图像-文本检索提供逐步功能增强网络
Jingyao Wang1, Zheng Liu1, Shanshan Gao1
1School of Computing and Artificial Intelligence, Shandong University of Finance and Economics, Ji'nan, 250014, Shandong, China; Shandong Key Laboratory of Lightweight Intelligent Computing and Visualization for Digital Economy, Ji'nan, 250014, Shandong, China.
概括
本研究介绍了一种步骤性功能增强 (SFE) 网络,通过捕获更丰富的语义线索来改善图像-文本检索. SFE网络有效地弥合了异质差距,以实现更好的跨模式理解.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 图像-文本检索 (ITR) 面临着挑战,原因是图像和文本模式之间的异质差距.
- 现有的ITR方法很难从个别对之外的大规模图像文本体中捕获全面的语义线索.
- 弥合异质差距需要更强的关联和全面的语义暗示捕获.
研究的目的:
- 提出一个新的双层阶段性功能增强 (SFE) 网络,以解决当前ITR方法的局限性.
- 建立一个语义传播途径,使信息从外部层流向内部层.
- 通过捕捉外部和内部语义线索来增强图像和文本之间的关联.
主要方法:
- 拟议的SFE网络使用双层方法来增强功能.
- 步骤1捕获来自补丁级,实例级和邻居级共发生的外部语义线索 (ESC),以增强外部层中的功能.
- 第二步将传播的语义信息融合在一起,并通过跨模态上下文挖掘内部语义线索 (ISC) 来增强内部层中的特征.
主要成果:
- SFE网络通过多层次的共同发生,有效地捕获外部语义线索,包括跨模态实例和邻居级别.
- 内部语义线索是通过交叉模式上下文挖掘的,进一步增强内部层中的视觉和文本特征.
- 实验结果表明,拟议的SFE网络的性能优于最先进的ITR方法.
结论:
- SFE网络成功建立了一个语义传播途径,逐渐指导语义信息流.
- 该方法有效地弥合了异质性差距,通过从大规模公司捕获全面的语义线索.
- 拟议的方法在图像文本检索任务中表现出卓越的性能.

