在生物医学数据集成的规模上对语义映射进行组装和推理
Charles Tapley Hoyt1,2, Klas Karis2, Benjamin M Gyori2,3
1Institute of Inorganic Chemistry, RWTH Aachen University, Aachen, NRW, 52074, Germany.
Bioinformatics (Oxford, England)
|September 29, 2025
概括
SeMRA集成了来自不同来源的生物医学概念标识符,推断缺失的链接以提高数据互操作性. 该工具创建了一个全面的数据库,连接以前没有链接的标识符空间,以更好地整合数据.
科学领域:
- 生物医学信息学 生物医学信息学
- 数据科学数据科学数据科学
- 生物信息学是一种生物信息学.
背景情况:
- 许多资源将独特的标识符分配给生物医学概念,如基因,疾病和细胞类型.
- 这些资源中的重叠标识符会造成数据互操作性挑战.
- 整合数据集需要映射这些不同的标识符,但现有的映射是不完整和碎片化的.
研究的目的:
- 开发一种可扩展的解决方案,用于从多个来源集成和映射生物医学概念标识符.
- 为了解决由碎片化标识符映射引起的数据互操作性瓶.
- 创建一个全面的生物医学概念映射资源.
主要方法:
- 开发了SeMRA,这是一种使用图形数据结构集成识别器映射的软件工具.
- 采用图形算法来推断缺失的映射,并保持来源和信心.
- 实现了一个可定制的工作流,接受源集成的声明规范.
主要成果:
- 创建了SeMRA原始映射数据库,包含来自127个来源的4340万张映射.
- 该数据库涵盖了来自445个本体和数据库的标识符,连接了以前没有链接的标识符空间.
- 通过对特定用例的基准来证明实用性,例如疾病和细胞类型资源集成.
结论:
- SeMRA有效地将分散的生物医学标识符映射集成到一个统一的图形结构中.
- 塞姆拉原始映射数据库显著提高了生物医学研究的数据互操作性.
- 该工具和数据库为连接各种生物医学知识库提供了宝贵的资源.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
07:35A Knowledge Graph Approach to Elucidate the Role of Organellar Pathways in Disease via Biomedical Reports
Published on: October 13, 2023
2.1K
