使用统计分析来探索影响数据不平衡的因素,用于机器学习识别人类转录组m6A修改站点的识别方法
Mingxin Li1, Rujun Li1, Yichi Zhang1
1College of Biomedical Engineering, Sichuan University, Chengdu 610065, China.
Computational biology and chemistry
|January 21, 2025
概括
这项研究使用深度学习来解决不平衡的RNA甲基化数据. 采用K-mer特征编码的mLSTM整体模型实现了对N6-甲基氨酸 (m6A) 位点的最佳预测.
科学领域:
- 生物信息学是一种生物信息学.
- 表观遗传学 在表观遗传学中,表观遗传学是指表观遗传学.
- 计算生物学 计算生物学
背景情况:
- RNA甲基化,特别是N6-甲基氨酸 (m6A),是基因表达的关键表观遗传调节剂.
- 准确识别m6A位点对于理解生物功能至关重要.
- 传统的m6A位点识别实验方法昂贵且劳动密集,需要计算方法.
研究的目的:
- 为了应对在机器学习模型中不平衡数据集的挑战,用于m6A站点识别.
- 探索功能编码,深度学习架构和数据重新采样策略,以提高预测准确度.
- 开发强大的计算工具,用于识别RNA甲基化位点.
主要方法:
- 利用K-mer一热编码用于RNA序列特征提取.
- 开发了深度学习模型,包括长期短期记忆 (LSTM) 和多重 LSTM (mLSTM).
- 采用集体和加权策略,以及序列生成对抗网络 (SeqGAN) 和合成少数重新抽样技术 (SMOTE) 进行数据平衡.
主要成果:
- 该K-mer一热编码策略有效地捕获了RNA序列特征.
- 集成和加权策略,以及SeqGAN和SMOTE,在不平衡的数据集上改善了模型性能.
- 具有K值5的mLSTM整体模型显示出最佳的预测性能.
结论:
- 特性选择,深度学习模型架构和数据采样技术显著影响m6A站点预测的准确性.
- 开发的方法为处理生物信息学数据不平衡提供了有效的解决方案.
- 这项研究为RNA甲基化位点识别和相关的计算生物学挑战提供了宝贵的见解和指导.


