通过无标签方法获得的蛋白质组数据的先进计算方法的全面评估
Grzegorz Wryk1, Andrzej Gawor2, Ewa Bulska2
1Faculty of Physics, University of Warsaw, Pasteura 5, 02-093 Warsaw, Poland.
International journal of molecular sciences
|January 8, 2025
概括
有效的归算方法对于准确的无标签定量蛋白质组学至关重要. 像随机森林 (RF) 和局部最小平方 (LLS) 这样的局部相似性方法显示出强大的性能,特别是当数据是对数时.
科学领域:
- 蛋白质组学是指蛋白质组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 在基于质谱的蛋白质组学中,无标签量化 (LFQ) 提供了成本效益和高吞吐量.
- 缺失值 (MV) 在LFQ数据中很普遍,影响了准确性,可重现性和可解释性.
- 处理MV的稳健方法对于可靠的蛋白质组数据分析至关重要.
研究的目的:
- 系统地评估各种归算方法的性能,以解决蛋白质组数据集中缺失的值.
- 评估蛋白质识别算法 (FragPipe,MaxQuant) 和数据逻辑化对归算有效性的影响.
- 为LFQ蛋白质组学选择最佳归算策略提供一个框架.
主要方法:
- 分析了十种归算方法,分为单值,局部相似性和全球相似性方法.
- 在模拟数据集上使用规范化根平均平方误差 (NRMSE) 和接收器运行特征曲线 (AUC) 下的面积来评估性能,这些数据集具有不同的MV速率,并且缺失的比例不是随机的 (MNAR).
- 推算策略也应用于真实蛋白质组数据集,以评估实际效用和真正分类.
主要成果:
- 局部相似性方法,特别是随机森林 (RF) 和局部最小正方形 (LLS),在各种缺失值场景中表现一致和强.
- 数据逻辑化显著提高了全球相似性归算方法的性能.
- 虽然蛋白质识别算法对归算错误的影响最小,但它们影响了真正蛋白质分类的数量.
结论:
- 建议使用局部相似性归算方法来处理无标签定量蛋白质组学中缺失的值.
- 逻辑化是一个有益的预处理步骤,特别是在全球相似性归算方法中.
- 根据数据特征量身定制的归算策略的知情选择对于提高蛋白质组研究的准确性和可重复性至关重要.


