中国临床命名实体识别与分割同义词句子合成机制:算法开发和验证.
Jian Tang1, Zikun Huang2, Hongzhen Xu1
1Department of Pharmacy, People's Hospital of Guilin, 12 Wenming Road, Guilin, 541000, China, 86 18978320258.
JMIR medical informatics
|December 2, 2024
概括
本研究介绍了一种用于临床命名实体识别 (CNER) 的新型数据集增强算法,通过克服数据稀缺性和标签挑战来提高模型性能. 分段同义词句子合成 (SSSS) 方法可以提高CNER模型的准确性,而不需要大量的手动注释.
科学领域:
- 自然语言处理自然语言处理.
- 机器学习 机器学习
- 生物信息学是一种生物信息学.
背景情况:
- 临床命名实体识别 (CNER) 对于从电子病历中提取信息至关重要.
- 深度学习模型在CNER中很普遍,但通常需要大型注释数据集和广泛的词典.
- 现有的CNER方法因文本复杂性,实体多样性和边界模糊性而面临挑战.
研究的目的:
- 为了解决CNER任务中的数据稀缺性和标签困难.
- 提出一个数据集增强算法,利用现有知识,而无需手动扩展字典.
- 为了提高CNER模型的通用化性能.
主要方法:
- 开发了使用近距离词计算和词汇细分的细分同义词句子合成 (SSSS) 算法.
- 从自然语言数据中重新组合同义词汇,以扩展数据集.
- 将SSSS算法应用于RoBERTa + CRF和RoBERTa + BiLSTM + CRF模型,对CCKS 2017年和2019年的数据集进行评估.
主要成果:
- 在CCKS-2017数据集中,SSSS + RoBERTa + CRF在F1得分上达到了91.30%.
- 在CCKS-2017数据集中,SSSS + RoBERTa + BiLSTM + CRF实现了91.35%的F1得分.
- 这两种模型在CCKS-2019数据集上都获得了超过83%的F1分数.
结论:
- SSSS算法有效地扩展了CNER数据集.
- 拟议的方法显著提高了CNER模型的性能.
- 这种方法成功地减轻了与数据采集,注释和模型概括相关的挑战.


