ConBGAT:一种结合卷积神经网络,变压器和图形注意网络的新型模型,用于从扫描图像中提取信息
Duy Ho Vo Hoang1, Huy Vo Quoc1, Bui Thanh Hung1
1Data Science Laboratory/Data Science Department/Faculty of Information Technology, Industrial University of Ho Chi Minh City, Ho Chi Minh, Vietnam.
PeerJ. Computer science
|December 9, 2024
概括
本研究介绍了ConBGAT,这是一种用于扫描图像信息提取的新型模型. 它通过整合图像和文本功能显著提高了准确性,设置了一个新的基准.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 传统的扫描图像信息提取方法难以有效地利用视觉和文本数据.
- 由于特征集成的局限性,现有的方法往往会产生低于最佳的准确性和效率.
研究的目的:
- 推出ConBGAT,这是一种旨在增强从扫描图像中提取信息的新型模型.
- 通过整合多种特征提取技术来解决传统方法的局限性.
主要方法:
- 开发了ConBGAT,这是一个结合卷积神经网络 (CNN),变压器和图形注意力网络的模型.
- 利用先进的光学字符识别 (OCR) 进行准确的文本区域分析和字符解释.
- 集成的CNN功能用于图像数据和来自变压器的蒸双向编码器表示 (DistilBERT) 用于文本数据.
主要成果:
- 在现实世界数据集上,ConBGAT显示出了与现有方法相比显著的性能改进.
- 该模型在从扫描图像中提取信息方面实现了卓越的准确性和效率.
- 多个指标的评估证实了综合方法的有效性.
结论:
- ConBGAT代表了扫描图像信息提取的重大进步.
- 该模型的综合方法为现场准确性和效率设定了新的标准.
- 这项工作突出了将CNN,变压器和图形网络相结合用于复杂数据分析的潜力.


