相关实验视频
Updated: Jan 9, 2026

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
9.9K
适应性伪文本增强用于噪音-坚固的文本到图像人重新识别
Lian Xiong1,2, Wangdong Li2, Huaixin Chen1
1School of Resources and Environment, University of Electronic Science and Technology of China, Chengdu 611731, China.
Sensors (Basel, Switzerland)
|December 11, 2025
概括
这项研究引入了一种新的文字对图像人重新识别 (T2I-ReID) 方法,可以有效处理杂的图像-文本对. 通过使用伪文本生成来识别和纠正错误的数据,它可以改善交叉模式对齐,以便更好地检索行人.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 文本到图像的人重新识别 (T2I-ReID) 依赖于对齐的图像-文本对.
- 现实世界的数据通常包含由于粗略的注释和错误而带来的噪音对.
- 现有的方法难以处理这些数据不完美,限制了T2I-ReID的性能.
研究的目的:
- 开发一种强大的T2I-ReID方法,能够处理杂的图像-文本对.
- 为了提高行人从图像/视频中检索的准确性和可靠性,使用文字描述.
- 在存在数据腐败的情况下,加强跨模式对齐.
主要方法:
- 使用对比性语言图像预训练 (CLIP) 提取特征.
- 用于细粒度表示的令牌融合模型 (令牌融合嵌入 - TFE).
- 高斯混合模型 (GMM) 用于噪音对的识别.
- 多模式大语言模型 (MLLM) 用于伪文本生成以纠正噪音数据.
主要成果:
- 拟议的方法有效地识别和减轻噪音图像-文本对的影响.
- 伪文本生成导致更可靠的视觉语义关联.
- 在多个基准数据集 (CUHK-PEDES,ICFG-PEDES,RSTPReid) 中显示了T2I-ReID性能的显著改善.
- 该模型与现有的基线方法具有良好的兼容性.
结论:
- 开发的T2I-ReID方法成功地解决了噪音图像文本数据的挑战.
- 噪音识别和伪文本生成策略在噪音条件下增强了跨模式对齐.
- 这项工作为构建更具弹性的T2I-ReID系统提供了一个有希望的方向.
