机器学习用于预测自发早产,使用第二和第三季度早期的母亲血液基因表达:一个警告故事
Kylie K Hornaday1, Ty Werbicki1, Suzanne C Tough2,3
1Department of Physiology and Pharmacology, Cumming School of Medicine, University of Calgary, Calgary, Alberta, Canada.
PloS one
|June 27, 2025
概括
使用基因表达生物标志物预测自发早产 (sPTB) 证明具有挑战性. 一项研究发现,以前的研究结果无法重现,机器学习模型无法泛化,突出显示了生物标志物研究中数据噪声和过度匹配的问题.
科学领域:
- 基因组学就是基因组学.
- 生物标志物发现发现
- 生殖健康 生殖健康
背景情况:
- 自发早产 (sPTB) 是新生儿死亡的主要原因,复杂的病因阻碍了预测.
- 之前的研究已经确定了sPTB的母体基因表达生物标志物,但验证和通用性仍然是关键的挑战.
研究的目的:
- 验证和扩展对用于sPTB预测的母性基因表达生物标志物的发现.
- 用基因表达数据评估各种机器学习模型和用于sPTB预测的传统统计方法的性能.
主要方法:
- 复制了2016年的一项研究,使用了来自所有我们的家庭队列的额外母亲血液样本.
- 使用五种建模方法 (随机森林,弹性网,后勤回归变体,神经网络) 对原始基因表达数据集的二次分析.
- 使用单独的妊娠队列对预测模型进行外部验证.
主要成果:
- 无法复制先前识别的sPTB.前列母性基因表达预测因子.
- 对于随机森林模型的高训练集性能 (AUROC 0.99),在测试 (AUROC 0.54) 和外部验证 (AUROC 0.50) 中显著降低.
- 与传统的统计方法相比,复杂的机器学习模型没有提高预测准确度,这表明过度拟合和普遍性差.
结论:
- 将基因表达生物标志物发现转化为对sPTB临床有用的预测模型面临重大障碍.
- 严格的方法保障,外部验证和解决数据噪声/过度装备对于高维的奥米克生物标志物研究至关重要.
- 未来的研究必须优先考虑强大的验证和机制性见解,以改善sPTB的理解和预测.


