优化生物医学实体关系提取方法,使用GPT-4和Gemini进行数据增强和分类
Cong-Phuoc Phan1, Ben Phan1, Jung-Hsien Chiang1
1Department of Computer Science and Information Engineering, National Cheng Kung University, No. 1, University Road, Tainan City 701, Taiwan.
Database : the journal of biological databases and curation
|October 9, 2024
概括
这项研究通过使用大型语言模型 (LLM) 增强了生物医学关系提取. 整合Gemini和GPT-4提高了模型性能,在NLP任务中实现了更高的精度,回忆和F1分数.
科学领域:
- 计算生物学 计算生物学
- 自然语言处理 (NLP) 是一种自然语言处理.
- 生物信息学是一种生物信息学.
背景情况:
- 生物医学关系提取仍然是一个挑战,尽管进行了广泛的研究.
- 现有的自然语言处理 (NLP) 技术需要进一步提高准确性.
- 大型语言模型 (LLM) 为提高NLP任务性能提供了一个新的机会.
研究的目的:
- 提高生物医学关系提取任务的准确性.
- 利用先进的大型语言模型 (LLM) 的功能,提高NLP性能.
- 介绍一种新的方法,将Gemini和GPT-4集成在一起,用于关系提取.
主要方法:
- 使用GPT-4生成增强训练数据.
- 采用集体学习技术,将各种模型输出结合起来,进行精确的预测.
- 微调 BioNLP-PubMed-Bert 分类模型,使用双子座的反应作为输入.
主要成果:
- 在BioCreative VIII Track 01数据集上,在精度,回忆和F1分数方面取得了更好的表现.
- 证明了将Gemini和GPT-4集成为生物医学关系提取的有效性.
- 微调的BioNLP-PubMed-Bert模型显示了显著的性能增长.
结论:
- 拟议的方法有效地提高了生物医学关系提取的准确性.
- 整合像Gemini和GPT-4这样的LLM为推动生物信息学NLP的发展提供了一个有希望的方向.
- 组合学习方法与微调结合,在复杂的NLP任务中产生了卓越的结果.


