对于中国电子医疗记录的命名实体认可,监管薄弱的方法
Meng Li1, Chunrong Gao2, Kuang Zhang2
1College of Computer Science and Technology, Zhejiang University, Zhejiang Province, Hangzhou, 310027, China.
Medical & biological engineering & computing
|July 15, 2023
概括
本研究介绍了MCBERT-GCN-CRF和CM-NER,这两种新的方法用于中医命名实体识别 (NER). 这些方法通过有效使用弱标记的数据来提高准确性,优于现有的模型.
科学领域:
- 自然语言处理自然语言处理.
- 医疗信息学 医疗信息学
- 机器学习 机器学习
背景情况:
- 训练准确的中医命名实体识别 (NER) 模型受到有限的高质量标记数据的阻碍.
- 现有的方法在标记不良的数据集中与噪音作斗争,影响了中国电子医疗记录的性能.
研究的目的:
- 提出一个联合培训模式 (MCBERT-GCN-CRF) 和一个框架 (CM-NER) 强大的中国医疗NER.
- 为了减轻弱标记数据中的噪声,以及桥梁监督和弱监督的NER方法.
- 提高在中国电子医疗记录中医疗实体识别的准确性和回忆率.
主要方法:
- 开发了MCBERT-GCN-CRF,这是一个集成BERT,图形卷积网络和条件随机字段的联合培训模型.
- 引入了CM-NER,这是一个五步框架,用于在弱标记数据中减轻噪声.
- 采用抑制噪音的技术,使未标记的数据能够有效地使用.
主要成果:
- 在CCKS-2019数据集上获得了86.29%的F1得分,超过了基线模型 (74.17-83.06%) 和最高监督模型.
- 与传统的完全监督的预培训模型相比,在回忆率和准确度方面取得了显著的改进.
- 通过有效处理杂的,标记不良的数据,超越了最先进的方法.
结论:
- 拟议的MCBERT-GCN-CRF和CM-NER框架有效地解决了中国医疗NER中的数据稀缺性挑战.
- 通过噪声抑制利用未标记的数据显著提高模型性能.
- 这项研究推进了医学自然语言处理,对患者护理有潜在的好处.


