语法受约束的解码用于结构化信息提取,使用微调的生成模型应用于临床试验摘要
David M Schmidt1, Philipp Cimiano1
1Center for Cognitive Interaction Technology (CITEC), Technical Faculty, Bielefeld University, Bielefeld, Germany.
Frontiers in artificial intelligence
|January 22, 2025
概括
语法受约束的解码显著改善了在资源较少的环境中提取信息,增强了从临床试验摘要中生成结构化数据. 然而,指针生成器的性能下降,突出了指导解码对准确性的重要性.
科学领域:
- 自然语言处理自然语言处理.
- 提取信息 提取信息
- 机器学习 机器学习
背景情况:
- 标准的编码解码模型难以保证信息提取 (IE) 中的语义和语法约束.
- 限制性解码方法,利用无上下文语法,提供了一种方法来强制执行输出结构.
- 域特定语法在指导IE系统对域数据模型合规性的有效性仍然是一个悬而未决的问题.
研究的目的:
- 实验性地研究语法约束的解码和指针生成器对特定域的IE性能的影响.
- 评估这些技术是否可以改善对微调编码器解码器模型 (Longformer,Flan-T5) 的信息提取结果.
- 在资源有限的环境中评估绩效,培训数据有限 (有数百个例子).
主要方法:
- 以C-TrO本体学为基础,将任务定义为填充临床试验摘要结构化表示的空格.
- 采用了Longformer和Flan-T5编码器-解码器模型,比较使用和不使用语法约束的解码和指针生成器的性能.
- 使用了211个注释的临床试验摘要的数据集,用于2型糖尿病和玻璃眼瘤.
主要成果:
- 语法受约束的解码显示出积极的影响,F1分数在2型糖尿病中增加0.351分 (至0.413分),而在青光眼中增加0.425分 (至0.47分).
- 指针生成器对结果产生了负面影响,F1分数在2型糖尿病下降了0.15 (至0.263),而在青光眼中则下降了0.198 (至0.272).
- 从语法受约束的解码中获得的最佳性能收益是在低资源设置中观察到的.
结论:
- 在低资源IE任务中用于结构预测的编码器-解码器模型从语法约束的解码中获得了显著的好处.
- 指针生成器模型显示性能下降,结果取决于基本模型和注意力聚合.
- 需要进一步的研究,以结构性地研究大型语言模型大小如何影响语法约束解码的好处.
相关概念视频
Improving Translational Accuracy
2.5K
2.5K
Genome Annotation and Assembly
18.8K
The genome refers to all of the genetic material in an organism. It can range from a few million base pairs in microbial cells to several billion base pairs in many eukaryotic organisms. Genome assembly refers to the process of taking the DNA sequencing data and putting it all back together in a correct order to create a close representation of the original genome. This is followed by the identification of functional elements on the newly assembled genome, a process called genome annotation.
18.8K
Conjugated Proteins
2.6K
2.6K
Cis-regulatory Sequences
3.0K
3.0K
Ligand Binding and Linkage
3.0K
3.0K
Protein Complexes with Interchangeable Parts
1.8K
1.8K


