半监督的基于文本的人物搜索
概括
这项研究引入了一种基于文本的人员搜索 (TBPS) 的新型半监督方法,克服了数据注释的挑战. 拟议的框架有效地处理噪音生成的数据,提高检索准确性,注释有限.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 基于文本的人员搜索 (TBPS) 通常需要广泛的注释图像文本数据来实现完全监督的学习.
- 获取人形图像的大型数据集的详细文本描述是实际上具有挑战性和资源密集的.
研究的目的:
- 在半监督的环境中探索和开发TBPS的有效方法,使用有限的注释数据.
- 为了解决现有的TBPS方法的性能限制,由于图像-文本对的注释很少.
主要方法:
- 提出了一个两阶段的生成-然后-检索框架,从使用图像标题生成未注释图像的伪文本开始.
- 引入了一个噪音强大的检索框架,包括混合补丁通道掩盖 (PC-Mask) 和噪音引导渐进训练 (NP-Train).
- PC-Mask通过在补丁和通道级别上掩盖输入数据来改进模型架构,以减轻噪音杂的伪文本的过度匹配.
- NP-Train通过基于伪文本噪音水平的逐步调度来增强训练,以实现稳健的学习.
主要成果:
- 拟议的半监督的TBPS框架在多个基准指标中显示出有前途的表现.
- 噪音强策略 (PC-Mask和NP-Train) 显著提高了模型处理杂伪文本数据的能力.
- 生成然后检索方法有效地利用有限的注释数据和生成的伪文本来改进检索.
结论:
- 半监督学习是TBPS的可行和有效方法,显著减少对完全注释的数据集的依赖.
- 开发的噪音强度检索框架为改善在低注释场景中的TBPS性能提供了实际解决方案.
- 这项研究通过解决数据稀缺性挑战,为更具可扩展性和高效的TBPS系统铺平了道路.
