GlySitePred:基于深度特征融合和NCR-CC采样技术识别甘修饰地点
Jiayue Liu1, Yun Zuo1, Youxu Tan2
1School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi 214000, China.
Journal of chemical information and modeling
|December 11, 2025
概括
GlySitePred使用先进的机器学习和蛋白质语言模型准确地预测蛋白质糖化位点. 这种计算工具克服了实验方法和现有算法的局限性,为糖化研究提供了实际支持.
科学领域:
- 生物化学和分子生物学
- 计算生物学 计算生物学
- 生物信息学是一种生物信息学.
背景情况:
- 蛋白质糖化是一种关键的翻译后修改,影响蛋白质功能和疾病.
- 实验性糖化位点检测是耗时且昂贵的.
- 现有的计算方法与不平衡的数据和特征冗余性作斗争,限制了预测准确性.
研究的目的:
- 开发一个准确可靠的计算模型来预测蛋白质糖化位点.
- 为了应对不平衡的数据和特征提取在糖化部位预测中的挑战.
- 为研究蛋白质糖化研究的研究人员提供实用工具.
主要方法:
- 从PLMD数据库中构建了一个高质量的人类蛋白质 lysine glycation 数据集.
- 集成的传统 (AAC,Kmer,One-hot) 和先进 (ESM2,ProstT5) 功能提取方法与多层次的功能融合.
- 使用NCR-CC低采样算法处理不平衡数据和XGBoost进行预测.
- 使用SHAP和LIME进行模型解释性分析.
主要成果:
- 与现有方法相比,GlySitePred模型在所有评估指标上显示出优异的预测性能.
- 该模型通过透明的决策过程实现了精确的预测能力.
- 该NCR-CC算法有效地缓解了数据不平衡问题.
- SHAP和LIME分析提供了对该模型预测机制的见解.
结论:
- GlySitePred在计算蛋白质糖化位点预测方面取得了重大进展.
- 该模型的准确性,可解释性和实用的工具支持增强了糖化修饰研究.
- 开源代码和交互式预测工具促进了更广泛的学术和实际应用.


