使用视觉转换器,VGG-16和ResNet-50增强孟加拉语手写字符识别:一个性能分析
A H M Shahariar Parvez1, Md Samiul Islam2, Fahmid Al Farid3
1Department of Software Engineering, Daffodil International University, Dhaka, Bangladesh.
Frontiers in big data
|December 1, 2025
概括
视觉转换器 (ViT) 在孟加拉语手写字符识别 (BHCR) 中实现了98.26%的准确性,超过了VGG-16和ResNet-50等CNN. 这证明了ViT的存在.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 孟加拉语手写字符识别 (BHCR) 面临的挑战是由于复杂的脚本和手写的变化.
- 现有的深度学习模型经常与孟加拉字符的细微差别作斗争.
研究的目的:
- 为了对BHCR进行视觉变压器 (ViT),VGG-16和ResNet-50的比较评估.
- 评估基于变压器的架构在提高BHCR准确性和通用性的有效性.
主要方法:
- 使用了CMATERdb 3.1.2数据集,其中包含50个基本孟加拉字符的24000张图像.
- 实现并比较了三个深度学习架构:视觉转换器 (ViT),VGG-16和ResNet-50.
- 分析模型行为,包括在卷积神经网络 (CNN) 和字符级别错误分类中的过拟合.
主要成果:
- 视觉变压器 (ViT) 实现了98.26%的最先进的精度.
- ViT的表现明显超过了VGG-16 (94.54%) 和ResNet-50 (93.12%).
- ViT在捕捉全球背景和远程依赖性方面表现出卓越的能力,导致更好的概括.
结论:
- 基于变压器的架构,特别是ViT,显示出强大而准确的BHCR的巨大潜力.
- 维特的表现为未来的孟加拉语字符识别研究奠定了新的基准.
- 这项研究为BHCR.com的模型行为和错误分类模式提供了宝贵的见解.
