计算和批量效应校正对蛋白质组/基组差异丰度分析的实际影响
Charis Gonidaki1,2, Agnieszka Latosinska3, Antonia Vlahou1
1Center of Systems Biology, Biomedical Research Foundation of the Academy of Athens (BRFAA), Athens, Greece.
Proteomics
|February 18, 2026
概括
在临床蛋白质组学中,选择正确的数据预处理方法至关重要. 批次校正,特别是不考虑疾病状态,可以删除重要的生物信号,影响慢性病研究中的生物标志物发现.
科学领域:
- 蛋白质组学是指蛋白质组学.
- 生物标志物发现发现
- 临床化学 临床化学
背景情况:
- 基于质谱 (MS) 的蛋白质组学对生物标志物发现有价值,但面临着缺失值和批量效应等挑战.
- 现有的归算和批量校正方法对大型临床蛋白质组学数据集的影响尚未完全理解.
- 慢性病 (CKD) 生物标志物研究需要强大的数据分析管道.
研究的目的:
- 评估常见的归算和批量校正方法对差异丰度分析的实际影响和相互作用.
- 为了评估这些方法对识别疾病相关 (DAP) 的影响,在一个大规模的CKD尿基因组数据集中.
- 了解预处理选择如何影响临床蛋白质组学中的生物信号保存.
主要方法:
- 分析了一套CE-MS尿液性学数据集,其中包括来自CKD患者和对照者的13批次1,050个样本.
- 测试了三种归算方法 (高斯式, 1⁄2 LOD, KNN) 与三种批次校正方法 (ComBat, ComBat与疾病共变量, MNN) 相结合.
- 通过在发现和验证集之间验证已识别的DAP来评估下游效应.
主要成果:
- 计算方法的选择对最终的DAP清单的影响很小.
- 批量效应校正显著改变了结果;MNN和未经调整的ComBat删除了大量DAP (~50%和>90%).
- 与未经调整的方法相比,在ComBat模型中包括疾病状态在很大程度上保留了生物信号.
结论:
- 预处理选择,特别是批量效应校正策略,极大地影响临床蛋白质组学下游结果.
- 归算和批量效应校正方法相互作用,共同影响DAP的识别.
- 应用批量效应校正需要谨慎,因为它可能导致有意义的生物信号丢失,强调需要仔细选择模型.


