合并后的批量正常化对综合多个异质研究的表型预测具有强大作用
1Department of Quantitative and Computational Biology, University of Southern California, Los Angeles, California, United States of America.
PLoS computational biology
|October 16, 2023
概括
基因组数据的异质性阻碍了机器学习预测. 通过解决批量效应和人口差异,ComBat规范化和整合方法可以提高交叉研究表型预测的准确性.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 机器学习 机器学习
- 计算生物学 计算生物学
背景情况:
- 基因组研究中的异质性显著损害了用于交叉研究表型预测的机器学习模型性能.
- 开发强大的机器学习算法需要克服数据异质性,以便在独立数据集上实现可重现的预测性能.
研究的目的:
- 尽管存在各种异质性,但对整合多样化的OMIC数据研究的最佳方法进行调查.
- 评估不同数据整合和批量规范化方法在提高交叉研究预测准确性的有效性.
主要方法:
- 开发了一种工作流来模拟各种类型的基因组数据异质性.
- 评估了多个数据集成策略与ComBat批量规范化相结合.
- 关于结直肠癌 (CRC) 的基因组和结核病 (TB) 基因表达数据集的应用和验证方法.
主要成果:
- 基因组研究异质性对机器学习分类器可重现性产生负面影响.
- 康巴特规范化提高了异质群体的预测性能,并消除了批量效应.
- 当培训和测试人群具有不同的潜在疾病模型时,预测准确性下降.
- 合并和集成方法的表现因场景而异,但随着ComBat正常化而改善.
结论:
- 批量规范化 (例如,ComBat) 对于减轻人口差异和交叉研究基因组数据中的批量效应至关重要.
- 合并策略和整合方法,当与批量规范化相结合时,都能实现良好的预测性能.
- 排名聚合方法为促进表型预测提供了一个可行的替代方案,与其他合体学习方法相比.


