IDPpub:通过PubMed采矿来照亮黑暗的蛋白质组
Sara R Savage1, Yaoyun Zhang2, Eric J Jaehnig1
1Lester and Sue Smith Breast Center, Baylor College of Medicine, Houston, Texas, USA; Department of Molecular and Human Genetics, Baylor College of Medicine, Houston, Texas, USA.
Molecular & cellular proteomics : MCP
|November 22, 2023
概括
这项研究介绍了IDPpub,这是一种深度学习工具,可以挖掘生物医学摘要,以识别和编目数千个酸化地点. 本资源通过为这些地点提供关键的功能和上下文证据,增强对蛋白质组的理解.
科学领域:
- 蛋白质组学是指蛋白质组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 全球蛋白组学产生了大量的数据,但解释酸化部位的功能和背景仍然具有挑战性.
- 有限的知识阻碍了对已识别的酸盐的生物作用和相关酶的理解.
研究的目的:
- 建立一个全面的矿库,并从生物医学文献中获得相关证据.
- 利用深度学习和自然语言处理来挖掘"黑暗的蛋白质组".
主要方法:
- 微调 BioBERT,一个生物医学文本挖掘工具,以创建 IDPpub 模型.
- 从MEDLINE摘要中提取了酸化部位,将蛋白质规范化为基因符号,并将部位映射到UniProt序列.
- 使用精选摘要验证模型性能,并使用CPTAC和PhosphoSitePlus数据集评估实用性.
主要成果:
- 在基质-酸提取的交叉验证中实现了高精度 (0.93) 和回忆 (0.94).
- 独立验证显示了0.91精度和0.77回忆的强大性能.
- 创建了一个18458个人类和5918个老鼠酸的存储库,并支持证据句子.
结论:
- IDPpub有效地从生物医学文献中提取和编译酸盐信息.
- IDPpub存储库作为一个有价值的资源,补充现有的数据库,并帮助蛋白质组研究.
- 可自动更新的存储库为发现和理解酸化站点功能提供了强大的工具.


