SciLinker:一个大规模的文本挖掘框架,用于绘制生物实体之间的关联
Dongyu Liu1, Cora Ames1, Shameer Khader1
1Target, Disease and Systems Biology, Cambridge, MA, United States.
Frontiers in artificial intelligence
|April 11, 2025
概括
天然语言处理管道SciLinker从数以百万计的生物医学摘要中提取基因疾病关联. 这种工具通过揭示重要的生物关系和潜在的治疗点来帮助药物发现.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 计算生物学 计算生物学
背景情况:
- 生物医学文献的快速增长需要自动化方法来提取生物实体之间的关系.
- 对数百万个摘要的手动探索是无法识别全面的生物关联的.
研究的目的:
- 开发一个高效和模块化的自然语言处理管道,用于分析整个PubMed抽象库.
- 提取和量化生物医学实体之间的关联,包括基因,疾病,细胞类型和药物.
主要方法:
- 利用开源库和预训练的命名实体识别模型来识别和将生物实体规范化到统一的医学语言系统 (UMLS).
- 实施了对实体共发生事件的统计学意义的评分方案.
- 应用了一个微调的PubMedBERT模型来提取基因疾病关系.
主要成果:
- 分析了超过3000万个关联句子,确定了超过125万个独特的基因疾病关联.
- 证明了SciLinker在提取特定基因疾病关系中的实用性,使用骨质疏松症作为案例研究.
- 展示了共发生数据如何构建疾病特定网络,以获得生物见解和目标识别.
结论:
- SciLinker是一种新的文本挖掘方法,用于从PubMed摘要中提取和量化生物医学实体协会.
- 它的模块化设计允许扩展到新的实体和公司,支持药物发现.
- 该工具将非结构化的生物医学数据转化为研究人员可操作的见解.


