探索机器学习策略,从多组数据中预测心血管疾病风险因素
Gabin Drouard1, Juha Mykkänen2,3, Jarkko Heiskanen2,3
1Institute for Molecular Medicine Finland (FIMM), HiLIFE, University of Helsinki, Helsinki, Finland. gabin.drouard@helsinki.fi.
BMC medical informatics and decision making
|May 2, 2024
概括
机器学习模型可以使用omics数据预测心血管疾病 (CVD) 风险因素. 多omics和半监督的自动编码器提高了预测准确性,为评估不同策略提供了一个平台.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组学就是基因组学.
背景情况:
- 机器学习 (ML) 分类器越来越多地用于预测心血管疾病 (CVD) 和使用omics数据的相关风险因素.
- 挑战包括分类结果和阶级失衡,对影响预测质量的因素的理解有限.
研究的目的:
- 为了比较不同的机器学习策略来预测心血管疾病风险因素.
- 评估ML分类器,omics数据类型和维度缩小技术对预测质量的影响.
主要方法:
- 使用血液衍生的代谢学,表观遗传学和转录学数据,比较了六个ML分类器.
- 使用无监督和半监督的自动编码器进行omics维度缩小.
- 使用meta-learner构建了多原子预测,并使用F1评分评估了性能.
- 在外部队列上使用预训练的自动编码器研究转移学习.
主要成果:
- 多omics预测通常优于单omics预测,特别是在极端的风险因素水平.
- 与无监督方法相比,半监督自动编码器提高了下游预测.
- 转移学习显示,转录组学的曲线下面面积中位数增长为0.09-0.14,代谢组学为0.07-0.11.
结论:
- 该研究为研究人员提供了一个框架,以评估omics数据,ML分类器和维度缩小对CVD风险因素预测的影响.
- 强调了多学科整合和先进的维度缩小技术的好处,以提高预测性能.


