扩大生物医学视觉语言模型的规模:微调,指令调整和多模式学习
Cheng Peng1, Kai Zhang2, Mengxian Lyu1
1Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida, Gainesville, FL, USA.
Journal of biomedical informatics
|October 25, 2025
概括
新的生物医学视觉语言模型BiomedGPT-Large和BiomedGPT-XLarge显示了23个数据集中的15个数据集的性能改善,在长文本任务和指令调整后的零射击学习中表现出色.
科学领域:
- 生物医学信息学是生物医学信息学.
- 人工智能的人工智能是人工智能.
- 计算机视觉 计算机视觉 计算机视觉
背景情况:
- 推进生物医学视觉语言模型对于多模式数据分析至关重要.
- 现有的模型在处理长文本和复杂指令方面面临挑战.
研究的目的:
- 开发和评估规模化的生物医学视觉语言模型 (生物医学GPT-Large,生物医学GPT-XLarge).
- 为了提高长文本任务和零射击学习的性能.
- 探索各种生物医学任务的高效采用.
主要方法:
- 开发了两个基于编码解码器变压器的模型:BiomedGPT-Large和BiomedGPT-XLarge.
- 在23个基准数据集上微调模型,跨越6个多模生物医学任务.
- 在大型多模式生物医学数据集上的指令调整模型.
主要成果:
- 新模型在17/23数据集上的表现优于之前的BiomedGPT-Base.
- 在15/23数据集上实现了最先进的性能.
- 在长文本的总结和理解方面显著改善 (4.6-11.4%).
- 指令调整增强了零射击学习和对齐精度.
结论:
- 开发的模型显著提升了生物医学视觉语言能力.
- 缩放,微调和指令调整是改善模型性能的有效策略.
- 视觉语言模型显示了在生物医学中整合多模式数据的巨大潜力.
相关概念视频
Improving Translational Accuracy
14.1K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.1K
Improving Translational Accuracy
3.5K
3.5K


