分割和保留:长尾视觉识别的双相建模
概括
这项研究针对在不平衡的长尾数据集上训练的视觉识别模型中的梯度扭曲. 一种新的双相方法解开了数据丰富和数据贫穷类的梯度,改善了模型训练和性能.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 深度学习 (Deep Learning) 是一种深度学习.
背景情况:
- 现实世界视觉识别数据集经常表现出长尾分布,其中少数类具有丰富的数据,许多类具有稀缺的数据.
- 现有的方法通常会整体地训练模型,从而导致梯度扭曲,梯度偏向于数据丰富的类,而数据贫穷的类则会使其不稳定.
- 这种梯度扭曲问题阻碍了在不平衡的数据集上有效训练视觉识别模型.
研究的目的:
- 提出一种新的方法,以减轻在长尾数据集上训练的视觉识别模型中的梯度扭曲.
- 通过解决极端数据不平衡所带来的挑战,提高视觉识别模型的性能.
- 制定一个培训策略,有效地处理数据丰富和数据贫困的类别.
主要方法:
- 引入了一种双相培训方法,以分离数据丰富和数据贫乏类的梯度.
- 第一阶段专注于更新模型参数,仅使用来自数据丰富类的梯度.
- 第二阶段将数据贫困类纳入学习完整的分类器,使用示例库和内存保留损失来实现顺的过渡和参数稳定性.
主要成果:
- 拟议的双相方法显著减少了梯度扭曲的负面影响.
- 对CIFAR100-LT,Places-LT,ImageNet-LT和iNaturalist 2018数据集的实验结果表明,与现有方法相比,它们的性能优越.
- 实例库和内存保留损失有效地维护来自数据丰富类的信息,并在阶段之间过渡期间稳定参数更新.
结论:
- 拟议的双相方法为在长尾数据集上训练视觉识别模型提供了有效的解决方案.
- 解开梯度和使用基于阶段的战略训练与记忆机制可以提高模型的准确性和稳定性.
- 这项工作为计算机视觉中失衡学习领域做出了有价值的贡献.


