部分注释学习用于生物医学实体识别
IEEE journal of biomedical and health informatics
|September 23, 2024
概括
部分注释学习有效地解决了生物医学命名实体识别 (BioNER) 中缺失的实体数据. 我们提出的TS-PubMedBERT-Partial-CRF模型显著提高了性能,即使存在大量数据缺口.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 计算生物学 计算生物学
背景情况:
- 生物医学命名实体识别 (BioNER) 对研究至关重要.
- 对于BioNER来说,高质量的注释数据是稀缺且昂贵的.
- 由于缺少注释,现有的方法与未标记实体问题作斗争.
研究的目的:
- 系统地评估BioNER的部分注释学习.
- 提出和验证一个新的部分注释学习模型,TS-PubMedBERT-Partial-CRF.
- 为了解决BioNER中缺少实体注释引起的性能下降.
主要方法:
- 在模拟的缺失实体注释场景中进行了全面的评估.
- 开发并测试了TS-PubMedBERT-部分CRF模型.
- 标准化了16个BioNER公司,其中有5种不同的实体类型用于基准测试.
- 与最先进的部分和完整注释模型进行性能比较.
主要成果:
- 部分注释学习方法有效地处理BioNER中缺少的实体注释.
- 拟议的TS-PubMedBERT-部分CRF模型的性能优于现有的部分注释模型.
- 我们的模型在高缺失实体率下实现了比PubMedBERT标记器高38%的F1得分.
- 实体提及召回证明了与完全注释的数据集的竞争对应.
结论:
- 部分注释学习是BioNER具有不完整数据的可行策略.
- 该TS-PubMedBERT-部分-CRF模型为BioNER提供了显著的进步.
- 这种方法减轻了缺失注释的影响,改善了模型性能和回忆.


