基于深度学习的印刷文档布局分析和光学字符识别系统
Dong-Lin Li1, Shih-Kai Lee2, Yin-Ting Liu2
1Department of electrical engineering, National Taiwan Ocean University, Beining Rd., Keelung City, 202301, Taiwan. ericli@email.ntou.edu.tw.
Scientific reports
|July 3, 2025
概括
本研究引入了用于文档分析和文本识别的深度学习系统. 它准确地在本地处理打印文档,将其转换为可编辑格式,如JSON.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 印刷文档处理通常需要专门的软件.
- 现有的光学字符识别 (OCR) 方法可能很慢或不准确.
- 深度学习为改进文档分析提供了潜力.
研究的目的:
- 开发一个高效,准确的深度学习系统,用于文档布局分析和文本识别.
- 为了使扫描文件和图像文件的本地处理.
- 以用户友好的,可编辑的格式输出识别的文本.
主要方法:
- 使用YOLOv4和YOLOv8深度学习模型进行文档布局分析 (识别标题,段落,表格,图像).
- 为每个已识别的文档元素实施了字符分割.
- 使用卷积神经网络 (CNN) 进行文本识别.
- 将已识别的文本集成到可编辑格式 (JSON,微软格式).
主要成果:
- 能够准确识别文件元素,如标题,段落,表格和图像.
- 通过CNNs在文本识别方面表现出高精度.
- 在本地计算机上启用了快速方便的OCR处理.
结论:
- 拟议的深度学习系统为文档布局分析和OCR提供了强大的解决方案.
- 该方法可显著提高本地文件处理的速度和准确性.
- 可编辑的输出格式提高了识别文本的可用性.


