对生物医学自然语言处理应用程序和建议进行大型语言模型的基准测试
Qingyu Chen1,2, Yan Hu3, Xueqing Peng1
1Department of Biomedical Informatics and Data Science, Yale School of Medicine, Yale University, New Haven, USA.
ArXiv
|October 1, 2025
概括
大型语言模型 (LLM) 在生物医学自然语言处理 (BioNLP) 中显示出潜力,但微调传统模型往往表现更好. 封闭源代码的LLM在推理方面表现出色,而开源模型则需要对BioNLP任务进行进一步优化.
科学领域:
- 生物医学自然语言处理 (BioNLP)
- 医疗保健中的人工智能
- 计算语言学 计算语言学
背景情况:
- 生物医学文献的指数增长需要自动化知识提取.
- 生物医学自然语言处理 (BioNLP) 为高效的信息合成提供了一个解决方案.
- 大型语言模型 (LLM) 在专门的BioNLP任务中的有效性尚未得到充分证实.
研究的目的:
- 系统地评估领先的大型语言模型 (LLM) 在各种生物NLP基准上的表现.
- 为了比较LLM性能 (零拍摄,少数拍摄,微调) 与传统的微调模型,如BERT和BART.
- 确定实际挑战,并为生物NLP的LLM应用提供见解.
主要方法:
- 在12个BioNLP基准和6种应用类型中对4个LLM (GPT,LLaMA代表) 的评估.
- 对LLMs的零射击,少数射击和微调方法的比较分析.
- 与微调的BERT和BART模型进行基准测试,包括对不一致性,幻觉和成本的分析.
主要成果:
- 传统的微调模型在大多数BioNLP任务中通常优于零或少射击的LLM.
- 封闭源代码的LLM (例如,GPT-4) 在推理密集型任务中表现出卓越的表现,比如回答医疗问题.
- 开源的LLM需要微调才能达到竞争性表现,并且观察到信息遗漏和幻觉等问题.
结论:
- 微调仍然是BioNLP的强大策略,经常超过基本的LLM提示.
- 特定的LLM对复杂的推理任务有希望,但需要仔细验证.
- 需要实用指导方针来解决LLM的局限性,并优化其在生物医学知识处理中的使用.
相关概念视频
Improving Translational Accuracy
14.1K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.1K
Improving Translational Accuracy
3.5K
3.5K


