用极小的样本规模分析蛋白质组学数据时应对统计方面的挑战:一项模拟研究.
Kyung Hyun Lee1, Shervin Assassi2, Chandra Mohan3
1Institute for Clinical Research and Learning Health Care, Department of Pediatrics, McGovern Medical School, The University of Texas Health Science Center at Houston, Houston, TX, USA. Kyung.Hyun.Lee@uth.tmc.edu.
BMC genomics
|November 15, 2024
概括
在小样本大小的蛋白质组学数据分析中,比较机器学习和缩小维度的方法,发现了类似的性能,但异质的生物标志物选择. 较大的样本大小可以提高生物标志物的稳定性,这对于疾病预测至关重要.
科学领域:
- 生物医学数据科学是生物医学数据科学.
- 蛋白质组学和临床数据整合.
- 发现生物标志物的发现.
背景情况:
- 整合蛋白质组学和临床数据有助于疾病预测和诊断.
- 临床蛋白质组学中的高维度和小样本大小挑战机器学习.
- 对于可复制和临床意义上的蛋白质组学结果的最佳分析管道尚不清楚.
研究的目的:
- 为了比较使用机器学习和缩小维度的9个不同的分析方案的性能.
- 在不同的分析方法中评估生物标志物选择异质性和生物途径相似性.
- 评估样本大小对蛋白质组学数据分析中的生物标志物稳定性的影响.
主要方法:
- 使用9个不同的方案对模拟蛋白质组学数据 (1317种蛋白质,26个受试者) 的分析.
- 包括机器学习和缩小维度的技术.
- 用不同的样本大小进行敏感性分析,以评估生物标志物的稳定性.
主要成果:
- 所有方案在小样本大小 (<30) 中都显示出高性能指标,这表明潜在的过拟合.
- 在被选为区分群体的特定蛋白质中观察到显著的异质性.
- 尽管蛋白质异质,但选定的生物标志物具有相似的生物路径和遗传疾病关联;更大的样本大小提高了生物标志物的稳定性.
结论:
- 广泛使用的分析管道在区分队列组和识别蛋白质组学数据中的常见生物途径方面也具有类似的性能.
- 由于潜在的异质性,当目标是精确定位特定的歧视性蛋白质时,仔细选择统计模型至关重要.
- 随着样本大小的增加,生物标志物的稳定性和可靠性得到了提高,这对于随后的调查至关重要.


