基于视觉预测增强的场景维吾尔人识别.
Yaqi Liu1,2,3, Fanjie Kong1,2,3, Miaomiao Xu1,2,3
1College of Information Science and Engineering, Xinjang University, No. 777 Huarui Street, Urumqi 830017, China.
Sensors (Basel, Switzerland)
|October 28, 2023
概括
本研究引入了改进的Uyghur场景识别模型,以解决文本变形和字符相似性问题. 改进后的模型可以在复杂的场景图像中对维吾尔文本进行更准确的视觉预测.
科学领域:
- 计算机视觉 计算机视觉
- 自然语言处理自然语言处理.
- 这是光学字符识别系统.
背景情况:
- 场景文本识别与维吾尔文本面临挑战,包括斜变形,字符粘附和相似性.
- 现有的方法很难在多样化和复杂的图像条件下准确地识别维吾尔文字.
研究的目的:
- 开发一个增强的Uyghur场景识别模型,具有改进的视觉预测能力.
- 为解决维吾尔语场景文本中扭曲文本,字符粘附和类似字符差异化的特定问题.
主要方法:
- 使用 TPS++ 来进行特征级别的扭曲文本校正.
- 改进了ABINet中的U-Net结构,以聚合水平特征并增强空间特征.
- 引入了一个视觉掩盖语义意识 (VMSA) 模块,以整合语言信息以更好地进行视觉预测.
主要成果:
- 拟议的模型有效地处理了维吾尔文本中的斜变形和字符粘附.
- VMSA模块通过利用语言上下文来帮助区分视觉上相似的维吾尔文字.
- 废弃实验验证了单个组件和整体模型的有效性.
结论:
- 增强的Uyghur场景识别模型在定制数据集上的现有方法相比显示出更高的性能.
- 通过VMSA模块整合视觉和语义信息对于准确的维吾尔语场景文本识别至关重要.
更多相关视频
04:48Application of Deep Learning-Based Medical Image Segmentation via Orbital Computed Tomography
Published on: November 30, 2022
2.8K
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
405
