迪亚-伯特:预训练的端到端变压器模型用于增强的迪亚蛋白质组学数据分析
Zhiwei Liu1,2,3, Pu Liu4, Yingying Sun1,2,3
1Affiliated Hangzhou First People's Hospital, State Key Laboratory of Medical Proteomics, School of Medicine, Westlake University, Hangzhou, Zhejiang Province, China.
Nature communications
|April 14, 2025
概括
新的人工智能工具DIA-BERT在数据独立采集质谱法 (DIA-MS) 蛋白质组学分析中显著改善了蛋白质和前体的识别. 它提高了癌症样本数据集的定量准确性.
科学领域:
- 蛋白质组学是指蛋白质组学
- 质谱测量质量谱测量
- 生物信息学是一种生物信息学.
背景情况:
- 数据独立采集质谱 (DIA-MS) 对定量蛋白质组学至关重要.
- 现有的DIA-MS分析工具在识别和量化蛋白质方面存在局限性.
研究的目的:
- 介绍DIA-BERT,这是一款用于分析DIA-MS数据的AI驱动软件.
- 评估DIA-BERT的性能与DIA-NN等现有工具相比.
主要方法:
- 使用基于变压器的AI模型开发了DIA-BERT.
- 在来自DIA-MS文件的超过2.76亿个前体上训练了识别模型.
- 在合成DIA-MS文件中的3400万个前体上训练了量化模型.
主要成果:
- 与DIA-NN相比,DIA-BERT实现了蛋白质识别的51%增加.
- 在五个人类癌症数据集中,DIA-BERT平均发现了22%的前体.
- 在复杂的蛋白质组样本中表现出高的定量准确性.
结论:
- 利用预先训练有素的人工智能模型和合成数据集显著增强DIA-MS数据分析.
- DIA-BERT代表了DIA蛋白质组学量化和识别方面的重大进步.
- 这些发现突显了人工智能在加速蛋白质原子发现方面的潜力.


