大型语言模型驱动的可转移的关键信息提取机制用于非标准化表格.
1Customs and Public Management College, Shanghai Customs University, Shanghai, 201204, China.
Scientific reports
|August 14, 2025
概括
本研究介绍了一种新的大型语言模型驱动可转移的关键信息提取机制 (LLM-TKIE),用于从非结构化表中提取数据. 在没有微调的情况下,LLM-TKIE表现出强大的性能和概括能力.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 从非结构化表中提取信息是具有挑战性的,因为布局变化和依赖大型注释数据集.
- 当前的方法与JSON等结构化格式的直接输出扎,限制了可扩展性和通用性.
研究的目的:
- 从非结构化表中提取关键信息的新机制,克服现有的局限性.
- 为了实现高精度和概括,而无需对特定任务进行微调.
主要方法:
- 提出了大语言模型驱动的可转移的关键信息提取机制 (LLM-TKIE).
- 使用文本检测和识别来从文档图像中提取内容.
- 使用大型语言模型 (LLM) 进行语义推理,完整性验证和结构化数据组织.
主要成果:
- 在CORD上获得F1得分为80.9和88.85,在SROIE上获得F1得分为83.9,在没有微调的情况下获得93.3的精度.
- 在未标记的海关领域数据集上,性能优于最先进的多式联运大型模型,准确度为5-8%.
- 评估了各种尺寸和量化策略的LLM绩效,以提供实践指导.
结论:
- 在从非结构化表中提取关键信息方面,LLM-TKIE表现出强大的概括性和结构精确性.
- 拟议的方法提供了一个可扩展和适应的解决方案,优于现有的方法.
- 为选择和优化用于信息提取任务的LLM提供了有价值的见解.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
578
07:26Executing Complexity-Increasing Queries in Relational MySQL and NoSQL MongoDB and EXist Size-Growing ISO/EN 13606 Standardized EHR Databases
Published on: March 19, 2018
9.4K
相关概念视频
Improving Translational Accuracy
2.7K
2.7K
Mechanistic Models: Compartment Models in Individual and Population Analysis
86
Mechanistic models are utilized in individual analysis using single-source data, but imperfections arise due to data collection errors, preventing perfect prediction of observed data. The mathematical equation involves known values (Xi), observed concentrations (Ci), measurement errors (εi), model parameters (ϕj), and the related function (ƒi) for i number of values. Different least-squares metrics quantify differences between predicted and observed values. The ordinary least...
86
