CCDPlus:为文本识别提供准确的字符对字符蒸
概括
通过字符对字符的蒸方法,CCDPlus通过使用未标记的真实数据 (URD) 和标记的合成数据 (LSD) 来增强场景文本识别. 这种方法克服了领域差距,并提高了现实世界文本识别任务的准确性.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 场景文本识别 (STR) 方法通常依赖于大规模合成数据 (LSD),但合成与真实领域的差距限制了性能.
- 没有标记的真实数据 (URD) 包含有价值的信息,但对STR有效利用它仍然具有挑战性.
- 之前在URD上自主监督的方法面临诸如粗略表示,不灵活的增强和真实到合成域漂移等问题.
研究的目的:
- 提出CCDPlus,一种新的角色对角色的蒸方法,用于强大的场景文本识别.
- 通过将URD和LSD整合到一个统一的框架中来解决现有方法的局限性.
- 在现实场景中提高STR模型的效率和稳定性.
主要方法:
- CCDPlus采用联合监督和自我监督的学习框架来识别场景文本.
- 它通过在线转移LSD的知识,将URD上的细粒度字符结构划定为表示单位.
- 该方法使灵活的字符对字符蒸具有多功能数据增强,提取可概括的字符级特征.
主要成果:
- CCDPlus实现了最先进的 (SOTA) 性能,优于监督,半监督和自我监督的方法.
- 在标准数据集上,它显示了比监督方法平均1.8%,比半监督方法平均0.6%,比自我监督方法平均1.1%的改进.
- 在具有挑战性的Union14M-L数据集中观察到6.1%的显著改善.
结论:
- 在场景文本识别中,CCDPlus有效地弥合了合成与真实领域的差距.
- 字符对字符的蒸方法提高了特征表示和识别精度.
- 统一框架成功地将URD的自我监督学习与LSD的监督学习相结合,以获得更高的绩效.


