利用基于变压器的模型和相关数据,用于放射学中的深度表型化.
Lluís-F Hurtado1, Luis Marco-Ruiz2, Encarna Segarra1
1VRAIN: Valencian Research Institute for Artificial Intelligence, Universitat Politècnica de València, Camí de Vera s/n, València, 46020, Spain; ValgrAI: Valencian Graduate School and Research Network of Artificial Intelligence, Camí de Vera s/n, València, 46020, Spain.
Computer methods and programs in biomedicine
|January 9, 2025
概括
本研究引入了一种结合自然语言处理 (NLP) 和链接数据技术的新方法,将非结构化的临床文本转化为可搜索的知识库. 这种方法通过从自由文本电子健康记录中实现高效的表型查询来增强对临床研究的数据再利用.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 链接数据技术 链接数据技术
背景情况:
- 电子健康记录 (EHR) 主要使用自由文本,阻碍了对临床研究的二次数据的使用.
- 目前对队列定义和患者匹配的查询机制严重依赖结构化数据和临床术语.
- 需要先进的方法来利用临床自由文本中包含的丰富信息.
研究的目的:
- 开发一种用于临床文本二次使用的方法.
- 使用自然语言处理 (NLP) 用于用生物医学术语标记临床笔记.
- 设计一种用于映射和分类识别标签的本体学,从而实现表型查询.
主要方法:
- 采用基于变压器的NLP模型 (RoBERTa) 来处理放射学报告并识别UMLS概念唯一标识符 (CUI).
- 将已识别的CUI映射到多个生物医学本体 (例如,SNOMED-CT,HPO,ICD-10) 进行表型化.
- 使用OWL结构构建了一个链接知识库 (LKB),用于自动推理和查询.
主要成果:
- 从注释的放射学报告开发了一个链接知识库 (LKB).
- 该LKB能够对特定的临床标准进行表达式,基于推理的自动查询.
- 成功展示了将自由文本转换为可查询的知识库的管道.
结论:
- 通过NLP和链接数据的整合,可以从标准的本体学中创建可扩展的知识库,超越了用于表型化的传统关系数据库.
- 这种方法有助于将自由文本实体自动映射到LKB,从而实现高效的表型查询.
- 该方法可扩展到其他语言,对大规模研究数据库和分布式数据源管理有价值.


