对于古阿拉伯手写文本识别的稀缺数据集
Rayyan Najam1, Safiullah Faizullah1
1Department of Computer Science, Islamic University, Madinah 42351, Saudi Arabia.
Data in brief
|September 10, 2024
概括
这项研究引入了用于光学字符识别 (OCR) 研究的古老阿拉伯手稿的新型数据集. 本资源有助于开发和验证阿拉伯语OCR和文本校正的深度学习模型.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 数字人文学科 数字人文学科
背景情况:
- 深度学习模型正在推进光学字符识别 (OCR) 功能.
- 对于古阿拉伯手稿OCR的公开可用的数据集存在重大差距.
- 现有的阿拉伯语OCR研究受到缺乏专业数据集的阻碍.
研究的目的:
- 为了解决OCR古代阿拉伯手稿数据的稀缺问题.
- 为培训,验证和测试深度学习模型提供有价值的资源.
- 支持阿拉伯语OCR和阿拉伯文本校正的研究.
主要方法:
- 收集并策划了古老阿拉伯手稿的数据集.
- 获取的图像和专家转录的文本基本真相.
- 数据集包括八本古代书籍,共计四十页.
主要成果:
- 成功创建并提供了古老阿拉伯手稿的独特数据集.
- 数据集包括图像和相应的文本.
- 收藏涵盖了不同的地理和历史时期.
结论:
- 引入的数据集对阿拉伯语OCR领域做出了重大贡献.
- 它使研究人员能够开发,增强,测试和概括深度学习模型.
- 这种资源对于推进阿拉伯语OCR和文本校正技术至关重要.


