规范化,非差异表达基因和数据源与机器学习性能的关联在转录和临床数据的数据集内部或跨数据集建模中
Fei Deng1, Lanjing Zhang1,2,3
1Department of Chemical Biology, Ernest Mario School of Pharmacy, Rutgers University, Piscataway, NJ, USA.
ArXiv
|March 10, 2025
概括
在肺腺癌中对机器学习 (ML) 模型进行交叉数据集测试表明,单独的转录组数据表现最好. 正常化和非差异表达基因可以提高数据集内部的性能,但不能提高跨数据集的性能.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 在瘤学中的机器学习
背景情况:
- 交叉数据集测试对于评估机器学习 (ML) 模型通用性至关重要,但大多数研究都侧重于数据集内部验证.
- 数据规范化和非差异表达基因 (NDEG) 的使用对跨数据集的ML性能在转录和临床数据中的影响仍然不清楚.
研究的目的:
- 调查数据源,规范化和NDEG与ML模型性能在肺腺癌跨数据集测试中的关联.
- 为了比较在不同数据集 (TCGA和ONCOSG) 上训练并测试的ML模型的性能.
主要方法:
- 利用TCGA和ONCOSG数据集中的肺腺癌病例的转录和临床数据.
- 使用各种ML算法进行交叉数据集测试,评估规范化和NDEG的影响.
- 比较性能指标,包括平衡精度 (BA) 和曲线下的面积 (AUC).
主要成果:
- 仅使用转录组数据的ML模型实现了最好的跨数据集性能,优于使用转录组和临床数据的模型.
- 在TCGA上训练ML模型和在ONCOSG上测试产生了明显更好的结果,而不是相反.
- 规范化和NDEG提高了数据集内部的性能,但没有改善跨数据集的结果.
- 支持矢量机 (SVM) 是在数据集内部和跨数据集评估中最一致的最高性能模型.
结论:
- 数据来源在肺腺癌交叉数据集评估中显著影响ML模型的性能.
- 仅仅转录组数据就足以进行强大的跨数据集ML建模,在某些情况下,临床数据的附加值有限.
- 规范化和NDEG策略对于数据集内部的模型调整是有益的,但不能增强跨不同数据集的概括性.


