数据增强基于WGAN-GP的数据块,以增强与RNA甲基化途径相关的基因的预测
Tuo Jiang1, Cong Shen2, Pingjian Ding3
1School of Computer Science, University of South China, Hengyang, 421001, Hunan, China.
Scientific reports
|November 2, 2024
概括
这项研究引入了一种使用生成对抗网络创建合成RNA甲基化数据的新方法,有效地解决数据不平衡,并提高生物研究的基因预测准确性.
科学领域:
- 分子生物学分子生物学
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- RNA甲基化对于人类的生物过程至关重要,是越来越多的研究领域.
- 准确预测RNA甲基化相关基因对于理解这些过程至关重要.
- 目前的预测方法受到积极样本稀缺的阻碍,导致数据不平衡.
研究的目的:
- 开发一种方法来缓解RNA甲基化相关基因预测中的类失衡.
- 用合成数据生成来提高基因预测模型的性能.
- 验证生成的合成数据在提高预测准确性的有效性.
主要方法:
- 使用生成对抗网络 (GAN) 来学习现有的RNA甲基化数据的特征分布.
- 使用分类器双样本测试 (CTST) 来控制生成的合成样本的质量.
- 将合成生成的样本集成到原始数据集中,以解决阶级不平衡问题.
主要成果:
- 提出的基于GAN的方法在包括合成样本时显著提高了各种分类器的预测性能.
- 合成数据集成在提高预测准确性方面超过了其他过量采样技术.
- 基因本体学 (GO) 丰富分析证实了预测的RNA甲基化相关基因的生物学相关性.
结论:
- 生成对抗性网络可以有效地创建高质量的合成数据,以克服RNA甲基化基因预测中的类不平衡.
- 提出的方法为提高RNA甲基化途径分析的准确性和可靠性提供了一个强大的解决方案.
- 开发的模型为研究RNA甲基化修饰的生物学家提供了有价值的工具.


