整合深度学习架构以增强生物医学关系提取:一个管道方法
M Janina Sarol1, Gibong Hong2, Evan Guerra2
1Informatics Programs, University of Illinois Urbana-Champaign, 614 E Daniel Street, Champaign, IL 61820, United States.
Database : the journal of biological databases and curation
|August 28, 2024
概括
这项研究引入了一种改进的管道,用于提取生物医学关系并从科学文本中检测新信息. 增强方法显著提高了命名实体识别和关系提取任务的性能.
科学领域:
- 生物医学自然语言处理 (NLP)
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 生物医学关系提取 (RE) 对于建立知识库和加速从科学文献中合成证据至关重要.
- 现有的方法在全面提取和新奇性检测方面经常面临挑战.
- 之前在BioCreative VIII BioRED轨道上的工作为这项研究提供了基础.
研究的目的:
- 为生物医学关系提取 (RE) 和新奇性检测 (ND) 开发一个增强的端到端管道.
- 整合最先进的深度学习方法并利用现有的数据集来提高性能.
- 解决文档级RE和ND的局限性.
主要方法:
- 一个集成的管道,包括命名实体识别 (NER),实体链接 (EL),RE和ND.
- 探索基于BERT的NER的序列标记和跨度分类.
- 针对疾病/化学EL的卷积神经网络 (CNN) 的开发,补充了PubTator 3.0.0.
- 基于BERT的PURE模型的调整,用于双向和文档级的RE和ND.
- 广泛的超参数调整.
主要成果:
- 增强的管道实现了与之前提交相比的显著改善:NER (93.53%, +3.09),EL (83.87%, +9.73),RE (46.18%, +15.67) 和ND (38.86%, +14.9).
- 基于BERT的NER,RE和ND模型,与混合EL方法相结合,产生了最佳性能.
- NER和EL模型表现出高性能,而RE和ND在文档层面仍然具有挑战性.
结论:
- 拟议的增强管道为生物医学关系提取和新奇性检测提供了显著的改进.
- 文档级的RE和ND提出了需要进一步研究的持续挑战.
- 未来的数据集增强可能会为生物医学NLP应用带来更准确和更实用的模型.


