乌尔都语诗歌手写图像数据集的自动编译用于光学字符识别
Irtaza Ijaz1, Abdallah Namoun2, Nasser Aljohani2
1Computer Science Department, Information Technology University of Punjab, Lahore, Pakistan.
MethodsX
|January 21, 2025
概括
本研究介绍了一种用于创建光学字符识别 (OCR) 数据集的自动化方法,用于低资源语言乌尔都语. 它利用手写的诗歌书籍和网页上删除的文本来构建必要的数字资源.
科学领域:
- 计算机科学 计算机科学
- 自然语言处理自然语言处理.
- 数字人文学科 数字人文学科
背景情况:
- 光学字符识别 (OCR) 对于数字化文本至关重要,但乌尔都语等低资源语言的开发受到缺乏数据集的阻碍.
- 乌尔都语复杂的文字和多样化的手写对现有的OCR技术构成重大挑战.
研究的目的:
- 开发一种用于生成乌尔都语手写文本大规模OCR数据集的自动化方法.
- 通过利用历史手写的诗歌书来解决乌尔都语OCR数字资源的稀缺问题.
主要方法:
- 使用邻里连接组件分析对手写的乌尔都文本图像进行自动句子级别的细分.
- 从在线源中获取相应的Unicode文本的网络扫描.
- 文本相似性分析和最小编辑距离,以与OCR引擎预测对齐,以创建准确的标签.
主要成果:
- 成功开发了一种用于为乌尔都语手写文本自动创建OCR数据集的新方法.
- 从米尔扎·加里布和阿拉玛·伊克巴尔的作品中创建了一套2888个手写的乌尔都语诗歌图像与Unicode转录的数据集.
- 该方法证明了高效的图像细分和文本对齐用于数据集生成.
结论:
- 提出的方法有效地自动创建像乌尔都语这样的低资源语言的有价值的OCR数据集.
- 这项工作有助于推进乌尔都语的OCR能力,使其丰富的文学遗产能够得到更广泛的数字化和访问.
- 利用历史文本和网络资源提供了一个可扩展的解决方案,用于为资源不足的语言构建数据集.


