组装预训练的语言模型,从文献中提取生物医学知识
Zhao Li1, Qiang Wei1, Liang-Chin Huang1
1McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston, Houston, TX 77030, United States.
概括
一个新的自然语言处理 (NLP) 系统在生物医学命名实体识别 (NER) 和关系提取 (RE) 中取得了顶级排名,超过了大型语言模型. 特定任务模型在生物医学文本挖掘方面表现出卓越的性能.
科学领域:
- 生物医学信息学 生物医学信息学
- 计算语言学 计算语言学
- 自然语言处理 (NLP) 是一种自然语言处理.
背景情况:
- 越来越多的生物医学文献需要自动化方法来提取概念之间的关系.
- 开发强大的NLP技术对于建立知识库和识别研究差距至关重要.
研究的目的:
- 为LitCoin挑战开发和评估一个NLP系统,专注于命名实体识别 (NER) 和关系提取 (RE).
- 使用手动注释的语料库对NLP方法进行基准测试.
主要方法:
- 组合学习结合了BioBERT,PubMedBERT和NER的BioM-ELECTRA. 这是一个非常好的方法.
- 一种基于规则的细胞系和分类学检测方法.
- 微调T0pp模型用于关系提取,结合实体位置信息.
主要成果:
- 在NER中获得第一名,在LitCoin挑战中在关系提取和新性预测中获得第二名.
- 微调模型在零射击设置中显著优于通用大型语言模型,如ChatGPT 3.5和4.
结论:
- 开发的NLP系统在生物医学实体的NER和RE中表现出高效率.
- 针对特定任务的NLP模型与用于专门的生物医学文本分析的通用大型语言模型相比,提供了更高的性能.


