通过使用CWGAN-GP数据增强框架,加强对不平衡的非目标代谢学数据集的监督分析
Francisco Traquete1, Marta Sousa Silva1, António E N Ferreira1
1FT-ICR and Structural Mass Spectrometry Laboratory, Faculdade de Ciências, Universidade de Lisboa, Portugal; Biosystems and Integrative Sciences Institute (BioISI), Faculdade de Ciências, Universidade de Lisboa, Campo Grande, 1749-016, Lisboa, Portugal.
Computers in biology and medicine
|November 15, 2024
概括
有条件的瓦斯斯坦生成对抗网络与渐变惩罚 (CWGAN-GP) 可以增强非目标代谢学数据,以改善不平衡的临床研究中的预测模型性能. 然而,在高度重叠的类别中,好处是有限的.
科学领域:
- 计算生物学 计算生物学
- 生物信息学是一种生物信息学.
- 代谢学 代谢学 代谢学
背景情况:
- 非定位代谢学对于生物系统的区分和生物标志物的发现至关重要.
- 数据分析的挑战包括大样本大小的要求和临床研究中常见的类不平衡.
- 类不平衡可以降低模型的概括性,增加过拟合,并导致结果偏差.
研究的目的:
- 调查使用有条件的瓦斯斯坦生成对抗网络与梯度惩罚 (CWGAN-GPs) 对代谢学数据的数据增强.
- 评估生成数据的质量和在增强数据集上训练的预测模型的性能.
- 评估数据增强对代谢学中的类不平衡的影响.
主要方法:
- 使用CWGAN-GP来增强代谢学数据集的数据.
- 对生成的数据应用多个质量评估标准.
- 评估监督预测模型在带有和没有增强数据的数据集上的性能.
- 在具有不同类别分离水平的基准数据集上测试模型.
主要成果:
- CWGAN-GP模型生成了现实的代谢学数据,与真实样本密切匹配,并避免了模式崩.
- 通过生成样本来增加少数群体类别,可以提高在具有良好的分离类别的不平衡数据集中的预测模型性能.
- 对于具有高类重叠的数据集,模型性能改进是适度的.
- 在不同类别分离的合成数据集中,结果一致.
结论:
- 使用CWGAN-GPs进行数据增强是一种可行的策略,可以解决代谢学中的类不平衡问题.
- 数据增强的有效性取决于数据集内的类分离程度.
- 增强并不是普遍有益的,其影响因数据特征而异.


