一种自我监督的语言模型选择策略,用于回答生物医学问题
Negar Arabzadeh1, Ebrahim Bagheri2
1University of Waterloo, Waterloo, ON, Canada.
Journal of biomedical informatics
|September 18, 2023
概括
一般用途预训练语言模型 (PLM) 可以在不需要昂贵的再培训的情况下实现特定领域的性能. 一种新方法使用分类器来选择每个生物医学问题的最佳PLM,提高准确性.
科学领域:
- 自然语言处理自然语言处理.
- 生物医学信息学 生物医学信息学
- 机器学习 机器学习
背景情况:
- 预训练的语言模型 (PLM) 在信息检索和NLP任务中表现出色.
- 域特定的PLM提供了高性能,但在计算上昂贵.
- 一般用途的PLM更容易获得,但可能缺乏域特异性.
研究的目的:
- 调查通用PLM是否可以在不需要再培训的情况下与特定领域的PLM性能匹配.
- 探索结合多个通用PLM的协同效应.
- 为特定领域的任务开发一个计算效率高的方法.
主要方法:
- 一个自我监督的分类器被训练来选择最适合的生物医学问题的通用PLM.
- 在BioASQ数据集上进行了实验,用于回答生物医学问题.
- 通过将具有和没有选择策略的通用PLM与特定领域模型进行比较来评估性能.
主要成果:
- 一般用途的PLM,当使用拟议的选择策略进行组合时,显示出协同效应的性能改善.
- 观察到16.7% (较轻的模型) 和14.2% (较大的模型) 的统计学显著改善.
- 该方法使通用PLM能够实现与PubMedBERT等特定领域模型相匹敌的性能.
结论:
- 利用智能选择策略的通用PLM是重新培训的计算效率高的替代方案.
- 这种方法提高了随时可用的PLM的实用性,用于生物医学等专业领域.
- 这些发现表明了改善生物医学问答系统的实际途径.
更多相关视频
相关概念视频
Improving Translational Accuracy
11.5K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
11.5K
Antibiotic Selection
54.7K
Overview
54.7K


