使用机器学习算法和两种数据分割方法对形淋巴瘤激酶 (ALK) 抑制剂的分类模型和SAR分析
1State Key Laboratory of Chemical Resource Engineering, Department of Pharmaceutical Engineering, Beijing University of Chemical Technology, 15 BeiSanHuan East Road, P.O. Box 53, Beijing, 100029, People's Republic of China.
Molecular diversity
|November 12, 2024
概括
研究人员开发了32种分类模型,以识别高度活跃的无细胞淋巴瘤激酶 (ALK) 抑制剂. 使用随机森林的最佳模型达到90.97%的准确性,揭示了强大的ALK抑制的关键结构特征.
科学领域:
- 药用化学 医学化学
- 计算化学计算化学
- 药物发现 药物发现 药物发现
背景情况:
- 无细胞淋巴瘤激酶 (ALK) 是癌症治疗中的一个关键目标.
- 开发有选择性和强大的ALK抑制剂对于有效的癌症治疗至关重要.
- 了解结构-活性关系有助于设计新型抑制剂.
研究的目的:
- 开发和评估用于预测ALK抑制剂活性的计算模型.
- 确定与高ALK抑制活性相关的关键结构特征.
- 为设计下一代ALK向治疗提供洞察力.
主要方法:
- 一组1810个ALK抑制剂的数据集被策划并使用自组织地图 (SOM) 和随机方法分为训练和测试集.
- 使用支持向量机器 (SVM),决策树 (DT),随机森林 (RF) 和极端梯度提升 (XGBoost) 使用MACCS和ECFP4指纹构建了分类模型.
- 采用K-Means集群和沙普利增量解释 (SHAP) 来分析结构特征和模型可解释性.
主要成果:
- 随机森林模型 (模型7D) 显示出卓越的性能,在测试组中实现了90.97%的预测准确性和0.79的马修斯相关系数 (MCC).
- 分析显示,特定的基结构,包括2,4-diarylaminopyrimidine类似物和pyrrolo[2,1-f][1,2,4]triazin,与高的ALK抑制活性显著相关.
- 四个不同的抑制剂集群与ALK抑制活性有很强的相关性,SHAP分析证实了模型捕获相关结构特征的能力.
结论:
- 计算模型,特别是随机森林,可以有效地预测ALK抑制剂的活性.
- 确定关键的药理特征为有效的ALK抑制剂的合理设计提供了宝贵的指导.
- 这项研究有助于持续努力开发针对ALK驱动癌症的向疗法.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
8.2K
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.7K
