HemPepPred:基于机器学习和蛋白质语言模型衍生特征的分离活性量的预测
Xiang Li1, Wanting Zhao1, Xiao Liang1
1Key Laboratory of Biorheological Science and Technology, Ministry of Education, College of Bioengineering, Chongqing University, Chongqing 400044, China.
Foods (Basel, Switzerland)
|December 11, 2025
概括
预测血溶性对于药物安全至关重要. 一个新的回归框架整合了蛋白质语言模型和氨基酸特征,提高了设计的准确性和可解释性.
科学领域:
- 生物化学 生物化学
- 计算生物学 计算生物学
- 药物发现 药物发现 药物发现
背景情况:
- 精确预测血溶性对于安全性评估和治疗设计至关重要.
- 现有的预测模型在准确性和可解释性方面存在局限性.
研究的目的:
- 开发一种先进的回归框架,用于预测血溶性活性.
- 为了提高血溶性预测的准确性和可解释性.
主要方法:
- 整合蛋白质语言模型嵌入 (ESM2_t33) 与手工制作的氨基酸描述器.
- 采用三个阶段的特征选择策略:差异过,F测试排名和相互信息分析.
- 使用随机森林,极端随机树木,梯度提升,XGBoost和回归构建一个集合模型.
主要成果:
- 整体模型在测试组中实现了0.57的确定系数 (R2) 和0.76的相关系数 (R).
- 该模型在预测血溶性度 (HC50) 值方面表现优于之前的方法.
- 沙普利值分析和Calibrated_Explanation算法提供了特征贡献和样本特定的解释.
结论:
- 拟议的框架显著提高了血溶性预测的准确性和可解释性.
- 开发的工具HemPepPred为合理的设计和安全评估提供了一个实用的平台.
- 这种方法促进了更安全,更有效的治疗性的开发.


