从西班牙临床叙述中提取乳腺癌信息的变压器
Oswaldo Solarte-Pabón1, Orlando Montenegro2, Alvaro García-Barragán3
1Centro de Tecnología Biomédica, Universidad Politécnica de Madrid, Madrid, Spain; Escuela de Ingeniería de Sistemas, Universidad del Valle, Cali, Colombia.
Artificial intelligence in medicine
|September 6, 2023
概括
变压器模型有效地从西班牙乳腺癌临床笔记中提取命名实体. 这种方法通过利用电子健康记录和深度学习来提取信息来增强临床研究.
科学领域:
- 自然语言处理自然语言处理.
- 临床信息学 临床信息学
- 生物医学文本挖掘 生物医学文本挖掘
背景情况:
- 电子健康记录 (EHR) 对临床研究非常有价值.
- 之前的研究在从EHR中提取西班牙癌症概念的范围有限.
- 深度学习在处理临床文本方面表现有前途.
研究的目的:
- 在西班牙乳腺癌临床注释中提出和评估基于变压器的命名实体识别 (NER) 方法.
- 为了比较各种语言模型对这个任务的性能.
- 开发一个用于注释乳腺癌概念的方案和语料库.
主要方法:
- 使用基于变压器的语言模型 (BERT,RoBERTa) 为NER.
- 在西班牙新开发的乳腺癌体上微调的模型.
- 使用F分数评估模型性能.
主要成果:
- 罗伯塔生物医学获得了最高的F分 (95.01%).
- 多语言的BERT和RoBERTa BNE也表现强 (分别为94.63%和94.54%).
- 贝托获得了93.71%的F分数.
结论:
- 变压器模型是有效的临床NER在西班牙语.
- 在生物医学文本上训练的模型产生了卓越的结果.
- 这种方法有助于利用转移学习从电子健康记录中有效地提取信息.
更多相关视频
11:18Generation of Comprehensive Thoracic Oncology Database - Tool for Translational Research
Published on: January 22, 2011
16.1K
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.3K
