在西班牙临床笔记上用于生物医学多类命名实体识别的多头CRF分类器.
Richard A A Jonker1, Tiago Almeida1, Rui Antunes1
1IEETA/DETI, LASI, University of Aveiro, Campus Universitário de Santiago, Aveiro 3810-193, Portugal.
概括
本研究引入了一种多头条件随机场 (CRF) 模型,用于西班牙临床文本中的多类生物医学命名实体识别 (NER). 该方法有效地处理重叠的实体,改善药物开发和临床研究的信息提取.
科学领域:
- 生物医学信息学是生物医学信息学.
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
背景情况:
- 生物医学命名实体识别 (NER) 对于从临床文本中提取信息至关重要,有助于改善治疗和药物开发.
- 传统的NER方法经常在复杂的生物医学领域与多类场景和重叠实体作斗争.
- 目前西班牙临床文档的方法有限,阻碍了大规模分析.
研究的目的:
- 为西班牙临床文档中的多类NER提出和评估一个多头条件随机场 (CRF) 模型.
- 解决生物医学文本中重叠实体实例的挑战.
- 通过结合SympTEMIST,MedProcNER,DisTEMIST和PharmaCoNER,创建西班牙最大的多类生物医学NER数据集.
主要方法:
- 实现了一个多头CRF分类器,同时处理多个实体类.
- 整合了四个西班牙生物医学数据集 (SympTEMIST,MedProcNER,DisTEMIST,PharmaCoNER) 形成一个全面的数据集.
- 执行实体链接到医学临床术语系统化命名法 (SNOMED CT) 词汇.
主要成果:
- 多头CRF模型实现了NER.的78.73%的微平均F1得分.
- 达到54.51%的端到端F1得分,用于对SNOMED CT.正常化的临床提及.
- 与单一类NER模型相比,已证明具有竞争力的性能.
结论:
- 拟议的多头CRF策略有效地处理西班牙临床文本中的多类NER和重叠实体.
- 综合数据集代表了西班牙最大的生物医学实体识别和链接的多类资源.
- 该方法为临床信息提取提供了可扩展和高效的解决方案,为关系提取铺平了道路.


