一种基于注意力特征提取和级联特征融合的多尺度自然场景文本检测方法
Nianfeng Li1, Zhenyan Wang1, Yongyuan Huang1
1College of Computer Science and Technology, Changchun University, No. 6543, Satellite Road, Changchun 130022, China.
Sensors (Basel, Switzerland)
|June 27, 2024
概括
本研究引入了一种新的多尺度场景文本检测方法,使用注意力特征提取和级联特征融合. 这种方法有效地提高了复杂的自然场景中的文本检测准确性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 场景文本检测对于应用程序至关重要,但与各种文本实例和复杂的背景作斗争.
- 现有的方法往往缺乏稳定性,无法捕捉不同的文本尺度,形状和环境复杂性.
研究的目的:
- 为自然场景提出一个强大的多尺度场景文本检测方法.
- 改进特征提取和融合,以增强文本检测能力.
主要方法:
- 开发了一种多尺度的方法,包括一个注意力特征融合模块 (DSAF),用于全球和本地注意力.
- 利用改进的级联特征融合模块 (PFFM) 集成特征地图并扩展受体场.
- 引入了一种轻量级的次空间注意模块 (SAM),用于特征地图分区和空间信息交互.
主要成果:
- 拟议的方法在ICDAR2015,Total-Text和MSRA-TD500数据集上显示出卓越的性能.
- 与现有方法相比,在准确性,回忆和F-score方面取得了显著的改进.
- 验证了基于注意力的多尺度方法的有效性和实用性.
结论:
- 提出的方法有效地解决了当前场景文本检测技术的局限性.
- 注意力机制和级联特征融合的整合增强了对各种文本实例的检测.
- 该方法为现实世界的场景文本检测挑战提供了实用和有效的解决方案.


