从文献中提取生物证据的Lit-OTAR框架
Santosh Tirunagari1, Shyamasree Saha1, Aravind Venkatesan1
1Literature Services Team, European Bioinformatics Institute, European Molecular Biology Laboratory (EMBL-EBI), Wellcome Trust Genome Campus, Cambridge CB10 1SD, United Kingdom.
Bioinformatics (Oxford, England)
|March 17, 2025
概括
启动的OTAR框架使用深度学习从科学文献中提取证据,通过识别新药标和验证关联来加速药物发现. 这个系统处理数以百万计的文章,揭示了数以百万计的目标疾病,目标药物和疾病与药物的关系.
科学领域:
- 生物医学信息学 生物医学信息学
- 药物发现 药物发现 药物发现
- 计算生物学 计算生物学
背景情况:
- 药物标的识别和验证是关键的,但复杂的过程.
- 从广的科学文献中提取可操作的见解是具有挑战性的.
研究的目的:
- 开发和实施一个深度学习框架 (lit-OTAR) 来自动从科学文献中提取证据.
- 通过识别和验证潜在的药物标及其相关关系来增强药物发现.
主要方法:
- 利用深度学习,专门命名为实体识别 (NER) 和实体规范化.
- 在科学文本中,NER识别了基因/蛋白质,疾病,生物和化学/药物实体.
- 实体规范化将已识别的实体映射到已建立的数据库 (Ensembl,EFO,ChEMBL).
主要成果:
- 处理了超过3900万份摘要和450万份全文文章和预印件.
- 确定了超过4850万个独特的协会.
- 发现了 >2990万个目标疾病,1180万个目标药物和830万个疾病与药物之间的关系.
结论:
- 启动的OTAR框架显著加速药物发现和科学研究.
- 自动化文献证据提取提供了一个可扩展的解决方案,用于识别药物向关联.
- 该框架的连续运行和广泛的数据处理证明了其实用性和影响.


