WBA:词语边界注意中国命名实体识别
1School of Computer Science and Technology, Tongji University, Shanghai, Shanghai, China.
PloS one
|December 23, 2025
概括
本研究介绍了Word Boundary Attention (WBA),用于改进中文自然语言处理. 通过建模字符位置和词语上下文,WBA增强了词语识别,实现了显著的性能增长.
科学领域:
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
- 人工智能的人工智能
背景情况:
- 中国语言表现出独特的结构性质,并行单词结构和顺序字符连接.
- 现有的方法可能无法完全捕捉中文文本中字符和单词之间的细微关系.
研究的目的:
- 为中国自然语言处理开发一种新的注意力机制,该机制明确模拟单词边界.
- 通过结合从词格子中获得的上下文信息来增强字符表示.
- 改进单词识别,并在序列标记任务中利用基于词典的上下文.
主要方法:
- 在相对位置编码方案的词中提取头和尾字符位置.
- 引入Word Boundary Attention (WBA) 以赋予字符动态注意力权重. 引入Word Boundary Attention (WBA) 以赋予字符动态注意力权重.
- 增强字符表示,使用来自词格子的上下文信息.
主要成果:
- 在多个数据集中,WBA的性能始终优于现有的方法.
- 在使用YJ词典编码的微博数据集上,与基准模型相比,实现了2.51%的改进.
- 视觉化揭示了单词和字符之间的可解释关系,为单词发现提供了洞察力.
结论:
- 注意力有效地模拟单词的界限,抑制噪音并改善中文NLP中的单词识别.
- 拟议的方法利用了更丰富的基于词汇的背景,从而实现了更高的性能.
- 该方法为单词级和字符级信息之间的相互作用提供了可解释的见解.


