通过优化深度学习识别刻录的斜体普什图数字
Sibtain Syed1, Khalil Khan2, Maqbool Khan1,3
1Department of IT & CS, Pak-Austria Fachhochschule Institute of Applied Sciences and Technology, Haripur, KP, Pakistan.
PeerJ. Computer science
|August 15, 2024
概括
本研究介绍了针对普什图语数字识别的优化机器学习模型. 长短期记忆 (LSTM) 模型在准确识别普什图语数字方面略高于卷积神经网络 (CNN) 模型.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 普什图语是东南亚广泛使用的语言,由于它的斜体文字,它对数值识别提出了独特的挑战.
- 传统的方法与普什图文字作斗争,需要先进的计算方法.
研究的目的:
- 开发和优化机器学习模型,用于精确的光学字符识别 (OCR) 的Pashtu数字 (0-9).
- 为了比较长期短期记忆 (LSTM) 和卷积神经网络 (CNN) 模型的性能.
主要方法:
- 一个数据集的Pashtu数字被组织,预处理 (重新调整到32x32,正常化),并分割 (80:20比).
- 用试错方法选择了LSTM和CNN模型的优化超参数.
- 用准确度,损失图,分类报告和混矩阵来评估模型性能.
主要成果:
- 无论是LSTM还是CNN模型,在识别Pashtu数字方面都取得了高精度,接近98%.
- 而LSTM模型在CNN模型上表现出了微不足道的性能优势.
- LSTM的宏观平均精度为0.9877,回忆率为0.9876,F1得分为0.9876.
结论:
- 优化的机器学习模型,特别是LSTM,对于普什图语数字识别是有效的.
- 提出的模型提供了一个强大的解决方案,以克服Pashtu的斜体文字所带来的挑战.
- 进一步的研究可以探索更复杂的架构,以提高普什图语OCR精度.


