Related Experiment Video
Updated: Aug 6, 2025

08:15
Capturing Dynamic Finger Gesturing with High-resolution Surface Electromyography and Computer Vision
Published on: March 28, 2025
679
A vast dataset for Kurdish handwritten digits and isolated characters recognition.
Peshraw Ahmed Abdalla1, Abdalbasit Mohammed Qadir2, Mohammed Y Shakor3
1Department of Computer Science, College of Science, University of Halabja, Halabja, Iraq.
Data in Brief
|March 20, 2023
Summary
This study introduces two large datasets, K-ZHMARA and K-PIT, for Kurdish handwriting recognition. These datasets contain thousands of images of digits and characters to advance optical character recognition for the Kurdish language.
Area of Science:
- Computer Science
- Artificial Intelligence
- Natural Language Processing
Background:
- Developing robust optical character recognition (OCR) systems requires extensive datasets for diverse scripts.
- The Kurdish language, particularly its central dialect, lacks comprehensive digital resources for handwriting recognition.
Purpose of the Study:
- To introduce and describe two novel, large-scale datasets for Kurdish handwriting recognition: K-ZHMARA for digits and K-PIT for characters.
- To facilitate research and development of OCR technologies for the Kurdish language.
Main Methods:
- Data collection involved printing Kurdish digits and characters on A4 papers with grids.
- Image processing techniques including scanning, segmentation, cropping, resizing, binarization, and inversion were applied using Python.
- The K-ZHMARA dataset comprises 70,000 images of Kurdish digits (7,000 per digit).
- The K-PIT dataset includes 245,000 images of Kurdish characters (7,000 per character).
Main Results:
- The creation of two substantial datasets, K-ZHMARA and K-PIT, totaling 315,000 images.
- Standardized image processing pipelines were established for data preparation.
Conclusions:
- The presented datasets are valuable resources for training machine learning models for Kurdish handwriting recognition.
- These datasets are expected to significantly contribute to the advancement of Kurdish OCR technology and digital inclusion.

