评估批量效应对相关缺失值对高通量生物医学数据下游分析的影响
Harvard Wai Hann Hui1, Wei Xin Chan1,2, Wilson Wen Bin Goh1,2,3,4,5
1Lee Kong Chian School of Medicine, Nanyang Technological University, 59 Nanyang Drive, Singapore 636921, Singapore.
Briefings in bioinformatics
|April 15, 2025
概括
批量效应相关的缺失值 (BEAMs) 通过影响缺失值赋值和批量效应校正,显著损害了数据分析. 诸如KNN,SVD和RF等特定的归算方法对BEAM特别脆弱,导致结果不可靠.
科学领域:
- 生物统计学 生物统计学
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 批量效应相关的缺失值 (BEAMs) 由集成具有不同特征覆盖范围的多批量omics数据产生的.
- 对于下游数据分析来说,BEAM 带来了重大挑战,包括缺失值归算 (MVI) 和批量效应校正 (BE).
研究的目的:
- 调查 BEAM 对各种 MVI 和 BE 校正算法的 (BECA) 性能的影响.
- 评估常用的MVI方法在与BEAM面对现实世界和模拟数据集时的稳定性.
主要方法:
- 模拟和分析现实世界的数据集 (例如,CPTAC).
- 评估了六种MVI方法 (KNN,Mean,MinProb,SVD,MICE,RF),以及两种BECA (ComBat,limma) 的使用情况.
主要成果:
- BEAMs显著降低了MVI性能,导致不准确的归算和膨胀的P值.
- 通过KNN,SVD和RF方法传播随机信号,导致错误的统计信心.
- 平均值和MinProb推算引入了文物,随着BEAM严重程度的增加,有害影响增加.
结论:
- BEAM需要全面的评估和量身定制的策略,以可靠地分析多批量omics数据.
- 当前的MVI和BE校正方法可能无法充分处理BEAM,从而损害数据完整性.
- 未来的研究应该专注于先进的模拟和专门的MVI方法,以有效地解决BEAM.


