OCm7G:一种可解释的单一类预测器,用于m7G甲基化位点,其训练使用极限负样本
Fei Li1, Jinbang Qin1, Zhaomin Yao2
1School of Intelligent Connected Vehicle, Hubei University of Automotive Technology, Shiyan, Hubei 442000, China.
Genomics
|December 13, 2025
概括
我们开发了OCm7G,这是一种用于检测N7-甲基瓜诺辛 (m7G) RNA修饰的AI工具. 它在现实世界不平衡的数据中脱而出,为疾病研究提供准确和可解释的结果.
科学领域:
- 生物化学 生物化学
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- N7-甲基瓜诺辛 (m7G) 是一种普遍存在的RNA修饰,与各种疾病有关.
- 精确的m7G位点检测对于理解其生物功能至关重要.
- 现有的检测方法通常是资源密集型的,人工智能模型在现实世界中常见的不平衡数据集中扎.
研究的目的:
- 开发一个强大的AI模型,用于准确的m7G站点检测,特别是解决数据集不平衡问题.
- 在现实的,不平衡的数据条件下对AI模型性能进行基准测试.
- 为m7G网站识别提供可解释的AI解决方案.
主要方法:
- 重建具有较低正负比的独立测试集,以模拟现实数据.
- 在平衡和不平衡数据集上对各种AI模型进行基准测试.
- 开发和实施OCm7G,这是一组具有层次值的单类分类器.
主要成果:
- 在平衡数据集上,OCm7G表现出与最先进的方法相匹配的性能.
- 在高度不平衡的场景中,OCm7G显著优于现有方法.
- 该模型在仅使用52.5%的训练数据时实现了高精度,并提供可解释的预测.
结论:
- OCm7G为m7G站点检测提供了优质的解决方案,特别是在不平衡的数据集中.
- OCm7G的可解释性有助于研究人员理解人工智能驱动的生物见解.
- 开发的工具和数据集是公开可用的,以推进RNA修饰研究.


