使用视觉转换器和卷积神经网络进行手写数字识别的混合深度学习框架的性能分析
Vanita Agrawal1, Jayant Jagtap2, Shruti Patil3
1Department of Computer Science and Information Technology, Symbiosis Institute of Technology, Symbiosis International (Deemed University), Pune, Maharashtra, India.
MethodsX
|January 31, 2024
概括
本研究介绍了一种混合卷积视觉变换器 (ViT) 模型,用于改进手写数字识别. 该模型在清洁和杂的真实世界数据上都表现出卓越的准确性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 数字化需要高效的手写文档识别系统,准确的数字识别对于数据分析至关重要.
- 卷积神经网络 (CNN) 实现了高精度,但由于固定的波器重量而缺乏适应性.
- 视觉变压器 (ViT) 和多层感知器 (MLP) 提供动态处理,导致对混合模型的兴趣.
研究的目的:
- 分析混合卷积视觉变压器 (ViT) 模型用于手写数字识别的有效性.
- 为了评估模型的性能在清理和未清理 (实时) 的手写数字图像上,考虑噪音和扭曲.
- 将拟议模型的精度与最先进的技术进行比较.
主要方法:
- 开发并评估了一种混合模型,将卷积神经网络 (CNN) 功能与视觉变压器 (ViT) 架构相结合.
- 利用清理和未清理的手写数字数据集来模拟现实世界的条件.
- 实现交叉验证和超参数调整以优化模型性能.
主要成果:
- 与现有方法相比,混合卷积ViT模型实现了最高的识别精度.
- 该模型在干净和杂的手写数字图像上都表现出了稳健性和有效性.
- 通过交叉验证和细致的超参数调整观察到性能增强.
结论:
- 拟议的混合卷积ViT模型为手写数字识别提供了强大的,可行的和高度准确的解决方案.
- 这些发现表明,有可能将这种方法扩展到识别手写文档中的其他元素.
- 混合模型在克服动态模式识别的传统CNNs的局限性方面取得了重大进展.


