通过自然语言文本处理和可解释机器学习方法从序列中准确预测抗蛋白
1School of Chemical Sciences, Indian Association for the Cultivation of Science, Jadavpur, Kolkata 700032, India.
The journal of physical chemistry letters
|November 27, 2023
概括
抗蛋白 (AFPs) 抑制冰晶的生长. 使用n-gram特征的新机器学习方法可以准确地从序列中识别潜在的AFP,其性能优于现有的方法.
科学领域:
- 生物化学 生物化学
- 计算生物学 计算生物学
- 机器学习 机器学习
背景情况:
- 抗蛋白 (AFP) 对于通过热歇斯底里抑制冰晶生长至关重要.
- 基于序列的AFP分类是具有挑战性的,因为序列相似性很低,使得像Blast和PSI-Blast这样的传统算法效率低下.
研究的目的:
- 开发一种加速方法,从序列中识别潜在的AFP.
- 通过机器学习提高AFP分类的准确性和效率.
主要方法:
- 使用了通过K-mer计数方法提取的n-gram特征向量.
- 采用机器学习模型,特别是比较各种算法.
- 应用了SHAP方法来获得功能活动洞察力.
主要成果:
- 在使用penta-mers作为特征向量时,Xgboost在预测AFP方面表现出卓越的表现.
- 拟议的方法在独立数据集上实现了高灵敏度 (97.50%),回忆 (98.30%),F1得分 (99.10%).
- SHAP方法为AFPs的功能活动提供了有价值的见解.
结论:
- 结合n-gram功能和机器学习,特别是Xgboost,为AFP识别提供了一种高效准确的方法.
- 这种方法显著优于现有的AFP序列分类技术.
- 这些发现为加强对抗蛋白的发现和理解铺平了道路.


