评估用于数字化历史文档的先进手写文本识别引擎.
C A Romein1,2,3,4, A Rabus5, G Leifert6
1Huygens Institute for the History and Culture of the Netherlands, Amsterdam, the Netherlands.
概括
本研究评估了手写文本识别 (HTR) 引擎用于数字化历史文档. 泰坦和TROCR-f在拉丁文字中表现出色,而其他在微调后在非拉丁文字中表现良好.
科学领域:
- 数字人文学科 数字人文学科
- 计算机科学 计算机科学
- 信息科学 信息科学 信息科学
背景情况:
- 数字化历史文档对于可访问性和研究至关重要.
- 评估手写文本识别 (HTR) 引擎性能对于有效的数字保存至关重要.
研究的目的:
- 批判性地评估和比较领先的HTR发动机的性能.
- 在各种历史文档数据集中评估它们的准确性和效率.
主要方法:
- 对五种最先进的HTR发动机进行比较分析:PyLaia,HTR+,IDA,TROCR-f和Titan.
- 用各种脚本,风格和历史拼写对数据集进行测试.
主要成果:
- 泰坦和TROCR-f在拉丁字体文档中表现出优异的即时性能.
- 在微调后,PyLaia,IDA和HTR+在特定的非拉丁文字中表现强.
- 所有引擎都从训练和微调中获得了显著的好处,包括语言模型集成.
结论:
- 选择HTR发动机取决于脚本和语言要求.
- 有效的数字化需要量身定制的培训,微调和语言模型集成.
- 这项研究为推进数字人文领域的HTR技术提供了洞察力.


