由LLM辅助的数据增强和多尺度特征提取赋权的一些生物医学NER.
Di Zhao1,2,3, Wenxuan Mu4, Xiangxing Jia4
1School of Computer Science and Engineering, Dalian Minzu University, Jinshitan Street, Jinzhou District, Dalian, 116650, Liaoning, China. zhaodi@dlnu.edu.cn.
BioData mining
|April 4, 2025
概括
这项研究引入了一种用于生物医学命名实体识别 (NER) 的新方法,使用ChatGPT进行数据增强和动态卷积进行特征增强,显著提高了几次拍摄的学习性能.
科学领域:
- 生物医学自然语言处理
- 机器学习 机器学习
- 计算生物学 计算生物学
背景情况:
- 命名实体识别 (NER) 对于生物医学文本分析至关重要.
- 由于有限的标记生物医学数据,探索了少数射击的学习方法.
- 现有的少数NER方法难以与完全监督的性能相匹配,并面临数据增强的挑战.
研究的目的:
- 为了增强几次射击的生物医学命名实体识别 (NER).
- 解决当前数据增强技术的局限性,这些技术可能会扭曲语义.
- 通过捕获多尺度句子信息来改善特征表示.
主要方法:
- 利用ChatGPT生成语义上丰富的数据来增强现有的数据集.
- 采用动态卷积来捕捉句子中的多尺度语义信息.
- 使用PubMedBERT作为基本模型进行增强的特征表示.
主要成果:
- 与最先进的模型相比,拟议的方法在四个生物医学NER数据集中的大多数几次射击场景中表现出更高的性能.
- 即使与像ChatGPT这样的大型语言模型相比,也观察到性能增长.
- 这种方法有效地提高了数据增强和模型概括能力.
结论:
- 这种新的方法通过改进数据增强和特征提取,显著提升了几次射击的生物医学NER.
- 基于ChatGPT的数据丰富和动态卷积的结合为低资源的NER任务提供了强大的解决方案.
- 这项研究为加强生物医学文献分析提供了一个有希望的方向.


