Related Experiment Video
Updated: Sep 17, 2025

05:58
Digital Handwriting Analysis of Characters in Chinese Patients with Mild Cognitive Impairment
Published on: March 11, 2021
4.7K
Assessing advanced handwritten text recognition engines for digitizing historical documents.
C A Romein1,2,3,4, A Rabus5, G Leifert6
1Huygens Institute for the History and Culture of the Netherlands, Amsterdam, the Netherlands.
Summary
This study evaluates Handwritten Text Recognition (HTR) engines for digitizing historical documents. Titan and TrOCR-f excel with Latin scripts, while others perform well on non-Latin scripts after fine-tuning.
Area of Science:
- Digital Humanities
- Computer Science
- Information Science
Background:
- Digitizing historical documents is crucial for accessibility and research.
- Evaluating Handwritten Text Recognition (HTR) engine performance is essential for effective digital preservation.
Purpose of the Study:
- To critically assess and compare the performance of leading HTR engines.
- To evaluate their accuracy and efficiency across diverse historical document datasets.
Main Methods:
- Comparative analysis of five state-of-the-art HTR engines: PyLaia, HTR+, IDA, TrOCR-f, and Titan.
- Testing across datasets with varied scripts, styles, and historical orthography.
Main Results:
- Titan and TrOCR-f demonstrated superior out-of-the-box performance for Latin-script documents.
- PyLaia, IDA, and HTR+ showed strong performance on specific non-Latin scripts after fine-tuning.
- All engines benefit significantly from training and fine-tuning, including language model integration.
Conclusions:
- HTR engine selection depends on script and language requirements.
- Effective digitization necessitates tailored training, fine-tuning, and language model integration.
- This research provides insights for advancing HTR technology in digital humanities.
Keywords:
Digital humanitiesHandwritten text recognition (HTR)Historical document digitizationIDALanguage modelsMultilingual contentPlanet AIPyLaiaTrOCRTranskribus
