在临床命名实体识别的机器辅助注释中使用主动学习策略:考虑注释成本和目标有效性的综合分析
Jiaxing Liu1, Zoie S Y Wong2,3,4
1School of Statistics and Mathematics, Zhongnan University of Economics and Law, Wuhan, Hubei 430073, China.
概括
动态主动学习 (AL) 策略提高了临床命名实体识别 (NER) 标注效率. 对于高效率,CNBSE策略减少了20.4%的编辑,而对于较低的目标,CLUSTER是有效的.
科学领域:
- 计算语言学计算语言学
- 生物信息学是一种生物信息学.
- 医疗信息学医学信息学
背景情况:
- 机器辅助注释对于创建高质量的临床数据集至关重要.
- 积极学习 (AL) 策略通过选择信息样本来优化注释.
- 将基于多样性和基于不确定性的AL纳入临床NER的动态框架尚未得到充分探索.
研究的目的:
- 调查动态AL策略在模拟机器辅助注释中对临床命名实体识别 (NER) 的有效性.
- 将新的动态AL策略与现有的效率和绩效方法进行比较.
主要方法:
- 提出了三个新的AL策略:CLUSTER (基于多样性),CLC和CNBSE (动态切换).
- 使用BioClinicalBERT作为三个临床NER数据集的基础NER模型 (i2b2 2009, n2c2 2018, MADE 1.0). 在这些数据集中使用BioClinicalBERT作为基础NER模型.
- 基于达到目标有效性所需的注释编辑的策略进行比较,与基于不确定性的 (LC,NBSE) 和随机抽样进行比较.
主要成果:
- 为了达到98%的目标有效性,CLUSTER需要最少的编辑.
- 与NBSE相比,CNBSE的编辑次数减少了20.4%,高难度实体的编辑次数减少了22.5%,达到99%的效率.
- 在基于池的模拟中,CLUSTER和RANDOM未能达到高效率目标 (分别为99%和93%).
结论:
- 动态策略 CNBSE 证明了在机器辅助临床NER注释中卓越的学习能力和成本效益,以实现高效率目标.
- 当可接受较低的有效性目标时,CLUSTER提供了最有效的注释.


