相关实验视频
Updated: Jun 10, 2025

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
9.0K
一种深度学习方法,用于线级的阿姆哈拉文盲字图像识别
Nega Agmas Asfaw1, Birhanu Hailu Belay2, Kassawmar Mandefro Alemu3
1Department of Computer Science, Woldia Institute of Technology, Woldia University, Woldia, Ethiopia. negaagmas3217@gmail.com.
Scientific reports
|October 15, 2024
概括
这项研究引入了阿姆哈拉语盲文识别的深度学习模型,实现了7.81%的字符错误率. 这种光学盲文识别系统简化了视力障碍者处理的过程.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 辅助技术 辅助技术 辅助技术
背景情况:
- 盲文对于视障人士的识字至关重要.
- 现有的光学盲文识别 (OBR) 系统面临的挑战是像阿姆哈拉语这样的复杂脚本.
- 阿姆哈拉文盲字需要两个单元,使识别复杂化.
研究的目的:
- 为阿姆哈拉语光学盲文识别 (OBR) 开发一种有效的深度学习模型.
- 为了应对阿姆哈拉文盲字中半个字符识别和字符细分的挑战.
- 提供强大的OBR解决方案,尽量减少图像预处理要求.
主要方法:
- 提出了一个深度学习模型,将卷积神经网络 (CNN) 和双向长期短期记忆 (BiLSTM) 与连接式时间分类 (CTC) 结合起来.
- 该模型在1800张阿姆哈拉文盲字线图上进行了训练,并在200张上进行了验证.
- 使用字符错误率 (CER) 评估性能.
主要成果:
- 性能最好的模型在测试数据上实现了7.81%的字符错误率 (CER).
- 该模型使用了48x256的图像尺寸,以获得最佳的结果.
- 序列对序列的学习方法被证明是有效的,没有大量的图像预处理或后处理.
结论:
- 拟议的深度学习模型为阿姆哈拉语光学盲文识别 (OBR) 提供了可行的解决方案.
- 这种方法简化了OBR过程,使其更容易获得.
- 第一个阿姆哈拉文盲字线图数据集已向研究社区发布.

