一个中文命名实体识别模型,包含循环单元和信息状态循环循环
1School of Computer and Software Engineering, Huaiyin Institute of Technology, Huaian, 223003, Jiangsu, China.
Scientific reports
|March 6, 2024
概括
我们推出了一个新的中国命名实体识别 (NER) 模型,IRCSR-NER,它增强了长序列特征提取. 该模型通过整合重复的单元格和语法依赖信息来提高复杂的中文文本的识别精度.
科学领域:
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
- 人工智能的人工智能
背景情况:
- 中国命名实体识别 (NER) 面临的挑战是语法复杂性和有限的长序列特征提取.
- 联合学习模型提高了NER准确性,但往往过度强调了局部特征,阻碍了长距离依赖性捕获.
研究的目的:
- 提出一种新的中国NER模型,即IRCSR-NER,可以克服长序特征提取的局限性.
- 加强对长实体界限的认可,并改善中文NER整体表现.
- 整合语法依赖信息,以更好地处理中文语言细微差别.
主要方法:
- 开发了纳入反复细胞和信息状态反复性 (IRCSR-NER) 模型.
- 集成的循环单元和信息状态循环,以改进序列特征提取.
- 利用语法依赖方法在单词层面上添加词汇关系信息.
主要成果:
- IRCSR-NER模型在提取长文本特征和捕获长距离依赖信息方面表现出卓越的性能.
- 在四个公共数据集上的实验结果显示,IRCSR-NER的表现优于传统和主流的中国NER模型.
- 该模型有效地平衡了局部特征重点与远程上下文信息.
结论:
- 拟议的IRCSR-NER模型显著提高了中国命名实体识别能力,特别是在长和复杂的序列.
- 整合循环单元和语法信息为推进中文等语法丰富语言的NER提供了一个有希望的方向.
- 对于中国的NER任务,IRCSR-NER提供了更有效,更准确的解决方案.


