MTSTR:通过双重注意力机制实现低分辨率场景文本识别的多任务学习及其在物流行业的应用
Herui Heng1, Si Li2, Peiji Li2
1Institute of Logistics Science and Engineering, Shanghai Maritime University, Shanghai, China.
PloS one
|December 12, 2023
概括
本研究介绍了一种先进的多任务学习方法,用于图像中的文本识别,通过一种新的超级分辨率分支 (SRB) 和双重注意力机制 (DAM) 增强低分辨率文本特征学习. 该方法在具有挑战性的数据集上实现了强大的性能.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 图像中的文本识别对于工业智能,机器人视觉和自动驾驶等应用至关重要.
- 现有的方法面临复杂系统和低分辨率文本的挑战,特别是在像中国这样的各种场景中.
- 需要进一步的研究来提高复杂的视觉环境中的文本识别准确性.
研究的目的:
- 提出一种新的端到端多任务学习方法,用于改进图像中的文本识别.
- 通过使用具有双重注意力机制 (DAM) 的专用超分辨率分支 (SRB) 来增强低分辨率文本特征的学习.
- 开发一个强大的系统来识别复杂的中国场景中的文本,解决传统数据集生成的局限性.
主要方法:
- 一个端到端的多任务学习框架,结合了超级分辨率分支 (SRB) 和识别分支.
- 使用特征金字塔网络 (FPN) 来融合高层次和低层次的语义图像信息.
- 实施一款具有双重注意力机制 (DAM) 的新型SRB,结合剩余通道注意力和字符注意力,以及用于识别的RNN序列模块和基于注意力的解码器.
主要成果:
- 拟议的方法在低分辨率的文本图像上表现出强大的性能.
- 在基准数据集上取得了具有竞争力的结果,验证了方法的有效性.
- 配有DAM的新型SRB显著提高了学习低分辨率文本特征的能力.
结论:
- 开发的多任务学习方法有效地解决了低分辨率文本识别方面的挑战.
- 整合FPN和基于DAM的SRB改进了语义信息融合和特征学习.
- 中国超分辨率数据集的创建为场景文本识别提供了更现实的训练基础.


