最好的坚持评估足以用于癌症转录组模型选择
Jake Crawford1, Maria Chikina2, Casey S Greene3,4
1Genomics and Computational Biology Graduate Group, Perelman School of Medicine, University of Pennsylvania, Philadelphia, PA, USA.
Patterns (New York, N.Y.)
|January 8, 2025
概括
简单的基因组模型并不总是更好. 这项研究发现,更小或更规范的基因特征不一定在数据集或癌症类型中更好地概括. 预测模型应根据持有数据的性能进行选择.
科学领域:
- 基因组学就是基因组学.
- 统计建模 统计建模
- 机器学习在生物学中的应用
背景情况:
- 统计建模指南通常偏爱基因组学更简单的模型,因为成本,可解释性和概括性的潜在好处.
- 假设较小的基因签名导致在各种生物背景和数据集中更好地泛化,这一假设是普遍存在的,但并不总是经验验证的.
研究的目的:
- 实证地测试小基因签名在突变状态预测中更好地概括的假设.
- 评估模型选择策略 (交叉验证与正规化交叉验证) 对基因组模型概括性能的影响.
主要方法:
- 开发了使用线性 (LASSO逻辑回归) 和非线性 (神经网络) 方法的突变状态预测模型.
- 通过测试不同数据集 (细胞系到人类瘤) 和生物背景 (不包含整个癌症类型) 的性能来评估模型概括.
- 比较模型选择仅基于交叉验证性能,而不是交叉验证和规范化强度的组合.
主要成果:
- 该研究没有发现证据表明,更规范或更小的基因特征始终更好地泛化.
- 这一发现在跨数据集和跨癌症类型概括问题中一致.
- 线性和非线性建模方法都在规范化签名的概括方面产生了类似的结果.
结论:
- 在基因组学中,更简单或更规范的模型在基因组学中本质上更好地概括的原则可能不适用于所有场景.
- 当在基因组学中寻求可概括的预测模型时,建议优先考虑在持有数据或通过交叉验证获得最佳性能的模型.
- 模型大小和规范化强度不应该是选择可概括的预测模型而不是经验性表现的主要标准.


