整合数据集,以单独预测基于DNA甲基化的生物标志物
Charlotte Merzbacher1, Barry Ryan1, Thibaut Goldsborough1
1School of Informatics, University of Edinburgh, Edinburgh, EH8 9AB, UK.
Genome biology
|December 5, 2023
概括
规范化方法在单独分析队列和一起分析队列时,对表观遗传分数 (EpiScores) 的影响不同. 一些方法尽量减少技术差异,这对于将新的DNA甲基化数据投射到参考面板上至关重要.
科学领域:
- 表观遗传学 在表观遗传学中,表观遗传学是指表观遗传学.
- 基因组学就是基因组学.
- 生物标志物发现发现
背景情况:
- 表观遗传分数 (EpiScores) 作为生活方式和疾病风险的生物标志物.
- 使用参考面板分析新的数据集是具有挑战性的,因为数组数据的技术和生物变化.
- 规范化方法标准化数据,但可能会掩盖人口层面的生物变异.
研究的目的:
- 为了比较16种正常化方法对BMIEpiScore和DNA甲基化年龄的影响.
- 评估如何将两个分别与一起的出生队列正常化对EpiScore估计的影响.
- 确定规范化策略,最大限度地减少技术变化,用于预测新的数据集.
主要方法:
- 将两个出生队列 (1921年和1936年的Lothian出生队列) 与血液DNA甲基化数据进行比较.
- 在BMIEpiScore和DNA甲基化年龄上评估了16种正常化方法.
- 单独分析队列,然后将其组合起来以实现正常化.
主要成果:
- BMI EpiScore使用SWAN规范化解释了LBC1936队列内的BMI最大24.5%的差异.
- 正常化方法对队列内估计的影响很小,但在队列单独正常化时与队列一起正常化时,导致个人级别EpiScore估计的差异.
- 在数组内部的规范化方法产生了相同的EpiScores,无论单独或联合的规范化,而不是在数组之间的方法.
结论:
- 最好采用能产生类似EpiScores的规范化方法,无论队列是单独分析还是一起分析.
- 这些方法有效地减少了在将新数据投射到参考面板上时的技术变化.
- 当原始数据不可用或联合规范化计算密集时,这种方法是有价值的.


