Related Experiment Video
Updated: Aug 15, 2025

05:56
Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
2.6K
A new dataset for mongolian online handwritten recognition
Yuecai Pan1, Daoerji Fan2, Huijuan Wu1
1College of Electronic Information Engineering, Inner Mongolia University, Hohhot, 010021, China.
Scientific Reports
|January 2, 2023
Summary
This study introduces MOLHW, a new Mongolian handwriting dataset. Transformer-based models achieved the best performance in Mongolian handwriting recognition, reaching a 16.969% word error rate.
Area of Science:
- Natural Language Processing
- Computer Vision
- Machine Learning
Background:
- Online handwriting recognition is crucial for digitizing handwritten text.
- Existing datasets lack sufficient coverage for the Mongolian language.
- Developing robust Mongolian handwriting recognition models requires a comprehensive dataset.
Purpose of the Study:
- Introduce the MOLHW (Mongolian Online Handwriting) dataset, the first of its kind for Mongolian.
- Establish baseline performance for Mongolian online handwriting recognition.
- Evaluate the effectiveness of different deep learning models for this task.
Main Methods:
- Collected 164,631 handwritten Mongolian word samples from 200 writers using a mobile application.
- Annotated data with Latin transliteration, writer ID, and device information.
- Developed and evaluated an encoder-decoder model with deep bidirectional GRU and attention, and a Transformer-based model.
Main Results:
- The baseline encoder-decoder model achieved a word error rate (WER) of 24.281%.
- The Transformer-based model significantly outperformed the baseline, achieving a WER of 16.969%.
- The Transformer model demonstrated superior ability in learning character sequences from coordinate data.
Conclusions:
- The MOLHW dataset is a valuable resource for Mongolian handwriting research.
- Transformer architectures show significant promise for Mongolian online handwriting recognition.
- The dataset supports applications in text recognition, generation, writer identification, and signature recognition.

