范纳2:使用多任务大型语言模型编码器实现更一般的生物医学命名实体识别
Yuxuan Liu1, Junyi Bian1, Weiqi Zhai1
1Institute of Science and Technology for Brain-Inspired Intelligence and MOE Frontiers Center for Brain Science, Fudan University, Shanghai, 200433 China.
Health information science and systems
|November 24, 2025
概括
VANER2通过使用大型语言模型 (LLM) 而没有因果注意力面具来改进生物医学命名实体识别 (BioNER). 这种新的方法增强了跨多种BioNER数据集的概括性,优于现有方法.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 机器学习 机器学习
背景情况:
- 生物医学命名实体识别 (BioNER) 对于下游任务,如关系提取和临床文本分析至关重要.
- 基于BERT的模型虽然占主导地位,但在不同的BioNER数据集中难以概括.
- 现有的微调自回归大语言模型 (LLM) 不适合BioNER,限制了性能.
研究的目的:
- 开发一种新的BioNER模型,克服以前方法的概括限制.
- 在生物医学领域有效地利用LLM来执行序列标记任务.
- 为了提高BioNER系统的性能和适应性.
主要方法:
- 使用LLM移除因果注意力面罩作为序列标签的文本编码器.
- 在39个BioNER数据集上训练了一种多任务命名实体识别 (NER) 模型,用于全面的实体提取.
- 提出了代币智能损失调整技术,以解决标签和实体类型之间的数据不平衡问题.
主要成果:
- VANER2模型在独立的测试数据集上展示了卓越的概括能力.
- 与基于BERT的基线和最近的BioNER方法相比,实现了最先进的性能.
- 成功地在一个单一的LLM中提取了所有实体类型.
结论:
- 通过有效地调整LLMs,VANER2为BioNER任务提供了增强的概括性.
- 提出的方法,包括因果注意力掩盖去除和损失重新缩放,显著提高了BioNER的性能.
- VANER2为生物医学文本分析提供了强大而可适应的解决方案.
相关概念视频
Improving Translational Accuracy
14.0K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.0K
Improving Translational Accuracy
3.5K
3.5K


