数据增强为少数镜头生物医学NER使用ChatGPT
Wenxuan Mu1, Di Zhao1, Jiana Meng1
1Dalian Minzu University, Dalian, 116650, China.
Artificial intelligence in medicine
|December 3, 2025
概括
本研究引入了一种新的数据增强方法,用于使用ChatGPT和快速学习进行生物医学命名实体识别 (NER). 该方法在低数据场景中提高了模型性能,在少数镜头设置中实现了高精度.
科学领域:
- 生物医学自然语言处理
- 机器学习 机器学习
背景情况:
- 数据稀缺是生物医学命名实体识别 (NER) 中的一个重大挑战.
- 少数拍摄的学习场景需要有效的数据增强 (DA) 来改善模型概括性并减少过度拟合.
- 现有的DA方法可能无法充分解决生物医学文本的复杂性.
研究的目的:
- 为生物医学NER任务提出一种新的DA方法.
- 利用像ChatGPT这样的大型语言模型 (LLM) 来生成高质量的数据.
- 为了提高NER模型在低数据和少数镜头设置中的性能.
主要方法:
- 利用ChatGPT和快速学习来提取NER的高质量数据.
- 员工转移学习和对实体识别的有效解码策略.
- 在四个公共生物医学数据集上进行实验:BC5CDR,NCBI,BioNLP11EPI和BioNLP13GE.
主要成果:
- 拟议的DA方法在极其有限的数据场景中显示出强大的稳定性和实体识别能力.
- 在四个数据集中,F1平均得分为72.96% (5次射击),75.05% (20次射击) 和77.42% (50次射击).
- 在少数NER任务中显示了模型概括能力的显著改进.
结论:
- 新的DA方法有效地解决了生物医学NER中的数据稀缺问题.
- 聊天GPT和快速学习为生成高质量的培训数据提供了强大的方法.
- 该方法显示了改善NER模型性能在具有挑战性的,低资源的生物医学领域的前景.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
03:37Author Spotlight: Impact of Intergenic Interactions on Disease-Identifying Dark Biomarkers
Published on: March 1, 2024
1.2K
