一个统一的医疗信息注释和提取框架,用于中国临床文本
Enwei Zhu1, Qilin Sheng2, Huanwan Yang2
1Ningbo No. 2 Hospital, Ningbo 315010, Zhejiang Province, PR China; Ningbo Institute of Life and Health Industry, University of Chinese Academy of Sciences, Ningbo 315016, Zhejiang Province, PR China.
Artificial intelligence in medicine
|June 14, 2023
概括
本研究介绍了使用自然语言处理 (NLP) 从电子病历 (EMR) 提取医疗信息的工程框架. 该框架,包括高质量的注释体,在提取医疗数据方面实现了接近人类的性能.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 医疗信息学 医疗信息学
- 计算语言学 计算语言学
背景情况:
- 电子医疗记录 (EMR) 包含有价值的临床数据.
- 从非结构化的临床文本中提取结构化的信息是具有挑战性的.
- 高质量的注释体和强大的工程工作流程对于医学信息提取至关重要.
研究的目的:
- 介绍医学信息提取的工程框架.
- 为解决EMR的NLP中高质量的注释 corpora和工程工作流程的瓶.
- 开发一个用于医学实体,关系和属性提取的系统.
主要方法:
- 开发了一个全面的注释方案,可以在多个NLP任务中兼容.
- 收集并手动注释了一个大规模的,高品质的中国临床医疗机构与医生的专业知识.
- 实施了一个工程框架,包括EMR数据收集,模型开发和性能评估.
主要成果:
- 医疗信息提取系统的性能接近人类注释水平.
- 开发的系统有效地从临床文本中提取医疗实体,关系和属性.
- 该框架促进了从数据收集到评估的完整工作流.
结论:
- 拟议的工程框架和注释集体显著提升了从EMR中提取医疗信息的速度.
- 公开发布注释方案,语料库和代码将促进该领域的进一步研究和开发.
- 该研究强调了在医疗NLP任务中使用专用资源和方法实现高性能的可行性.


