使用基于AI的混合方法增强手写文本识别
Supriya Mahadevkar1, Shruti Patil2, Ketan Kotecha2
1PhD Research Scholar, Symbiosis Institute of Technology, Symbiosis International (Deemed University), Pune 412115, India.
MethodsX
|March 21, 2024
概括
本研究介绍了一种混合方法,用于手写文本识别 (HTR),使用卷积神经网络 (CNN) 和双向长短期记忆 (BiLSTM) 与连接式时间分类 (CTC) 解码器. 该方法显著提高了从图像中识别手写文本的准确性.
科学领域:
- 计算机视觉 计算机视觉
- 图像处理 图像处理
- 人工智能的人工智能
背景情况:
- 手写文本识别 (HTR) 对于检查和处方阅读等应用至关重要.
- 挑战包括各种手写,复杂的布局和有限的数据集,阻碍光学字符识别 (OCR) 的准确性.
- 深度学习和机器学习的进步为HTR提供了新的可能性.
研究的目的:
- 为了提高手写文本从图像识别的准确性.
- 通过一种新的混合方法来解决HTR现有的挑战.
主要方法:
- 一种混合模型,集成卷积神经网络 (CNN) 来进行特征提取.
- 使用双向长短期内存 (BiLSTM) 网络进行序列建模.
- 使用连接式时间分类 (CTC) 解码器来准确生成输出.
主要成果:
- 拟议的混合模型在IAM数据集上实现了98.50%的准确性.
- 该模型在RIMES数据集上达到98.80%的准确性.
- 证明了手写文本识别的实质性准确性改进.
结论:
- 混合CNN-BiLSTM-CTC模型有效地提高了手写文本识别的准确性.
- 这种方法显示了现实世界HTR应用的巨大潜力.
- 这些架构的集成提供了一个强大的解决方案,用于从图像中准确识别字符.


