一种改进的数据增强方法及其在医疗命名实体识别中的应用
Hongyu Chen1, Li Dan1, Yonghe Lu2
1School of Information Management, Sun Yat-Sen University, Guangzhou, 510006, China.
BMC medical informatics and decision making
|August 5, 2024
概括
数据增强通过创建更多的培训数据来增强医疗命名实体识别 (NER). 新的方法,上下文随机替换 (CRR) 和目标实体随机替换 (TER),提高了准确性,特别是在有限的医疗数据.
科学领域:
- 自然语言处理自然语言处理.
- 生物信息学是一种生物信息学.
- 机器学习 机器学习
背景情况:
- 医疗命名实体认可 (NER) 面临着诸如高数据采集成本,专业术语和有限的培训资源等挑战.
- 这些挑战阻碍了医疗NER系统的高性能.
- 数据增强对于生成合成数据,平衡分布,丰富数据集和改进模型概括是必不可少的.
研究的目的:
- 为医疗NER提出新的数据增强技术.
- 解决医疗领域的数据稀缺和不平衡问题.
- 提高基于深度学习的中国NER模型的性能和准确性.
主要方法:
- 基于Word2Vec增强 (CRR) 的上下文随机替换.
- 目标实体随机替换增量 (TER).
- 与基于深度学习的中国NER模型 (BERT-BiLSTM-CRF) 的集成.
主要成果:
- 无论是CRR还是TER方法都显著提高了医疗NER的性能.
- 伯特-BiLSTM-CRF模型取得了显著的F1得分,增强了83.587%的得分.
- 这比基线模型的性能增加了1.49%,验证了增强策略.
结论:
- 数据增强对于改善医疗NER至关重要和有效,特别是在资源限制下.
- 拟议的CRR和TER方法为增强医疗NER系统提供了实际解决方案.
- 这些技术有助于更准确,更强大的医疗实体的识别.


