有必要进行边界注释吗? 评估无边界方法以提高临床命名实体注释效率:案例研究
Gabriel Herman Bernardim Andrade1, Shuntaro Yada1, Eiji Aramaki1
1Graduate School of Science and Technology, Nara Institute of Science and Technology, Ikoma, Japan.
JMIR medical informatics
|July 2, 2024
概括
命名实体识别 (NER) 的新注释方法显著减少了注释时间,并改善了临床文本中的注释者协议. 虽然模型性能略有下降,但这些方法为更快的临床NLP开发提供了有价值的妥协.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 临床信息学 临床信息学
- 机器学习 机器学习
背景情况:
- 命名实体识别 (NER) 在NLP中至关重要,但面临注释挑战,特别是在临床文本中.
- 确定精确的实体界限会导致注释者意见分歧,并减缓库的创建.
- 现有的方法往往涉及漫长的指导方针或裁决,增加过程的复杂性.
研究的目的:
- 评估两种新的注释方法:宽松的跨度和点注释.
- 为了减轻临床NER中精确确定实体边界的困难.
- 解决注释效率和数据质量之间的权衡问题.
主要方法:
- 一个用日本医疗病例报告数据集进行的案例研究.
- 标注时间,标注者协议和标签质量的比较.
- 评估对NER系统性能的影响,对新注释进行培训.
主要成果:
- 观察到总体注释时间减少了高达25%.
- 与传统方法相比,在注释者协议方面实现了10%的改进.
- 在宽松注释上训练的NER模型显示性能略有下降.
结论:
- 在临床NER中,注释速度和模型性能之间存在平衡.
- 减少工作量和增加注释速度是新方法的显著好处.
- 这些发现为临床NLP应用提供了实际的妥协.


