格兰塔手写字符识别的GHCR-A数据集
Basaraboyina Yohoshiva1, Nagendra Panini Challa1
1VIT-AP University, Amaravati, Andhra Pradesh, India.
Data in brief
|September 10, 2024
概括
为了帮助机器学习研究,创建了一个新的手写Grantha字符的数据集,包括数字和元音. 这个资源解决了Grantha脚本可用的数据缺口,支持印度语言技术开发.
科学领域:
- 计算机科学 计算机科学
- 语言学的语言学.
- 数字人文学科 数字人文学科
背景情况:
- 格兰塔文字在南印度语言中具有历史意义,但缺乏足够的数字数据集用于研究.
- 对于Grantha字符识别的现有资源是有限的,阻碍了相关AI应用的进步.
研究的目的:
- 介绍手写Grantha字符 (数字和元音) 的综合数据集.
- 为开发和评估Grantha字符识别机器学习模型提供一个基准资源.
- 为了促进与格兰塔文字有关的印度语言的研究.
主要方法:
- 收集了来自不同年龄组的10个格兰塔数字和34个元音的手写样本.
- 数字化和预处理5852张图像,包括细分,大小调整和灰度转换.
- 将数据组织成图像和CSV格式,并为机器学习提供相应的标签.
主要成果:
- 最终的数据集包含1330个数字样本和4522个元音样本.
- 数据集包括44个不同的格兰塔字符,每个字符有133个手写样本.
- 数据以图像和CSV格式提供,适合立即使用.
结论:
- 这一数据集填补了格兰塔文字研究的关键缺口,特别是在数字和元音识别方面.
- 它是机器学习计划的基础资源,专注于Grantha影响的印度语言.
- 预计这一数据集的可用性将刺激脚本识别和自然语言处理领域的进一步创新.


