High-quality data selection-driven instruction tuning for biomedical large language models

Jieqiong Zheng1, Lu Sun1, Xinyu He2

  • 1Dalian Neusoft University of Information, No. 8 Software Garden Road, Ganjingzi District, Dalian, 116000, China.

Summary

This study introduces a novel data selection framework to improve large language model (LLM) training for biomedical natural language processing (NLP) tasks. The BiomedicalLLM model, trained using this framework, achieved a 3.3% average F1-score gain.