基于机器学习的规则违规的预测,用于评估类分子中的药物相似性,使用随机森林模型
Momchil Lambev1, Dimana Dimitrova1, Silviya Mihaylova1
1Medical College, Medical University of Varna, 84 Tzar Osvoboditel Str., 9002 Varna, Bulgaria.
International journal of molecular sciences
|September 13, 2025
概括
这项研究开发了随机森林模型来预测类药物相似性,解决了传统规则的局限性,如Lipinski的五项规则 (Ro5). 这些模型为口服类药物开发提供快速和可靠的in silico评估.
科学领域:
- 药用化学 医学化学
- 计算化学的计算化学
- 药理学 药理学是指药理学的学科.
背景情况:
- 类疗法往往不符合传统的小分子药物相似度启发式,如利宾斯基的五项规则 (Ro5).
- 这需要开发适应的过器和数据驱动的方法,用于早期评估类药物相似性.
- 现有的计算工具可能无法完全捕捉的独特特性.
研究的目的:
- 开发和验证可靠的计算模型,用于预测类疗法的药物相似性.
- 将随机森林模型的性能与已建立的药物相似性标准和现有软件进行比较.
- 使用in silico过器识别具有潜在口服开发能力的候选人.
主要方法:
- 策划了PubChem.的药物和非药物化合物的大型数据集 (>300,000个分子).
- 使用RDKit提取了分子描述符,并计算了Ro5,超出-Ro5 (bRo5) 和Muegge标准的违规计数.
- 训练和评估随机森林分类器和回归模型,将预测与瑞士ADME,Molinspiration和26个测试分子的手动计算进行比较.
主要成果:
- 随机森林模型表现出高性能,Ro5精度/精度/回忆率为1.0,Muegge标准精度约为0.99.
- 对于大多数,Ro5违规计数与参考值密切匹配,其中较小的偏差归因于较大的分子大小.
- bRo5的预测显示与手工计算的高度一致,而Muegge的预测是一致的,但与瑞士ADME相比,往往低估.
结论:
- 随机森林模型提供了一个快速,可靠和准确的in silico方法来评估的药物相似性.
- 这些模型可以有效地支持优先考虑具有口腔开发潜力的候选者.
- 开发的过器对评估治疗的传统启发式方法进行了改进.


