使用命名实体识别改进从病理学报告中提取信息
Ken G Zeng1, Tarun Dutt2, Jan Witowski2
1New York University, New York, NY, USA.
Research square
|July 18, 2023
概括
本研究引入了基于BERT的命名实体识别 (NER) 系统,用于从病理学报告中提取详细的诊断信息. 使用数据增强的增强模型在各种医疗数据集中实现了高准确性和概括性.
科学领域:
- 医疗信息学 医疗信息学
- 计算语言学 计算语言学
- 医疗保健中的人工智能
背景情况:
- 病理学报告对于医学研究至关重要,包含全面的诊断数据.
- 现有的自然语言处理 (NLP) 来从这些报告中提取信息的方法在细节性和通用性方面存在局限性.
- 报告中的语言变化,否定和人为错误妨碍了准确的自动化分析.
研究的目的:
- 开发一个强大的系统,从病理学报告中提取关键诊断元素.
- 克服现有的报告分类和概括问题的局限性.
- 提高从医学文本中自动提取信息的细粒度和准确性.
主要方法:
- 提出了一个基于BERT (变压器的双向编码器表示) 的命名实体识别 (NER) 系统.
- 引入了四种数据增强技术,以提高模型的稳定性.
- 在美国一家医疗中心的1438份注释乳腺病理学报告上训练和评估了该系统.
主要成果:
- 带有数据增强的BERT NER系统在内部测试集上获得了0.916的实体F1得分.
- 这一表现超过了基线BERT模型 (F1得分0.843).
- 该模型表现出强大的通用性,在阿联的外部数据集上获得0.860的F1得分.
结论:
- 开发的NER系统有效地从各种病理报告中提取细粒度的诊断信息.
- 这种方法为医学和人工智能研究中大规模信息提取提供了潜力.
- 该研究强调了BERT和数据增强对于强大的医疗NLP任务的有效性.
更多相关视频
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
16.0K
08:08Detection and Isolation of Cancer in Prostate Biopsies Using Stimulated Raman Histology and Artificial Intelligence
Published on: June 10, 2025
101
