通过基于场景的快速设计以两阶段的LLM进行零射击的文档级生物医学关系提取
Lei Zhao1, Ling Kang1, Quan Guo1
1Neusoft Research Institution, Dalian Neusoft University of Information, Dalian, Liaoning 116023, China.
Computational biology and chemistry
|February 28, 2026
概括
这项研究引入了一种新的生物医学关系提取零射击框架,使用大型语言模型来识别化学,疾病和基因相互作用,而无需特定任务的培训数据.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 计算生物学 计算生物学
背景情况:
- 文件级生物医学关系提取具有挑战性,因为长文本中的复杂相互作用.
- 监督方法需要大型,昂贵的注释数据集,在专业领域很少.
- 现有的方法需要大量的计算资源进行微调.
研究的目的:
- 为生物医学关系提取提出一个新的零射击框架.
- 利用大型语言模型 (LLM) 和结构化提示来克服数据和计算限制.
- 为了使生物医学知识从漫长的科学文本中有效地提取出来.
主要方法:
- 一个两阶段的框架,利用结构化提示与LLMs.
- 第1阶段:对化学,疾病和基因实体进行命名实体识别和规范化,包括同义词/超标词提取.
- 第二阶段:根据预定义的方案提取关系,并使用基于场景的设计原则进行快速评估.
主要成果:
- 在ChemDisGene和CDR基准上与最先进的监督方法相比,取得了竞争性表现.
- 消除了对特定任务培训数据的需求.
- 显著降低了计算需求.
结论:
- 结构良好的零射击提示是生物医学知识提取的可行和资源高效的方法.
- 拟议的框架表明了LLMs在专业科学领域的潜力.
- 该方法为传统的监督方法提供了一个切实可行的替代方案,用于关系提取.

