一个强大而高效的算法,用于分析和识别中国历史文档.
Chongyu Liu1, Cheng Jian1, Jiarong Huang1
1School of Electronic and Information Engineering, South China University of Technology, China.
National science review
|June 9, 2023
概括
本研究介绍了一种有效的算法,用于理解中国历史文献. 它使用先进的文本检测,识别和阅读顺序预测来提高准确性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 数字人文学科 数字人文学科
背景情况:
- 中国历史文献由于其复杂的布局和多样化的脚本,给自动理解带来了独特的挑战.
- 现有的方法经常与多导向文本和确定正确的阅读顺序扎.
研究的目的:
- 开发一种新高效的算法,以全面理解中国历史文献.
- 为解决历史文本的文本检测,识别和阅读顺序预测方面的局限性.
主要方法:
- 一个多方向文本检测器识别文本区域,无论他们的方向.
- 一个基于双路径学习的文本识别器准确地转录检测到的文本.
- 基于启发式的阅读顺序预测器确定了信息的逻辑流.
主要成果:
- 拟议的算法在处理中国历史文档方面表现出高效率和准确性.
- 三个组件的整合导致了强大的文档分析.
结论:
- 这种新的算法为中国历史文献的自动化理解提供了重大进步.
- 该方法为未来的数字人文和历史文本分析研究提供了基础.


