如何构建能够从标准推断到改性的机器学习模型
Raúl Fernández-Díaz1,2,3,4, Rodrigo Ochoa5, Thanh Lam Hoang6
1IBM Research, Dublin, Ireland. raul.fernandezdiaz@ucdconnect.ie.
Journal of cheminformatics
|November 28, 2025
概括
标准生物活性的预测模型可能无法可靠地预测改性的行为. 这项研究调查了化学改性的计算建模挑战,这对于药物发现至关重要.
科学领域:
- 生物化学和化学信息学
- 计算化学计算化学
- 药理学 药理学是指药理学的学科.
背景情况:
- 生物活性是一种具有治疗潜力的多功能天然产品.
- 化学修饰增强了的药理学,但也带来了计算建模的挑战.
- 对于标准类存在丰富的数据,但对改性类的数据有限.
研究的目的:
- 评估在标准数据上训练的预测模型的可靠性,当它们应用于改性时.
- 探索生物活性的计算建模的关键方面,包括相似性函数和分子表示.
- 为了评估基于相似性的数据集分区,用于模型验证.
主要方法:
- 研究了相似性函数对数据集分区对模型评估的影响.
- 检查了不同的分子表示模型的模型.
- 利用基于相似性的数据集分区来创建不同的培训和测试集.
- 评估在标准数据和修改数据上训练的模型的性能.
主要成果:
- 该研究确定了影响改性预测模型可靠性的关键因素.
- 这些发现强调了适当的相似性函数和分子表示在计算模型中的重要性.
- 数据集分区策略显著影响模型概括到修改的结构.
结论:
- 使用标准数据开发的预测模型在应用到化学修饰时可能会显示可靠性降低.
- 仔细考虑相似度指标和分子表示是改造生物活性的精确计算建模的必要条件.
- 强大的验证策略,如基于相似性的分区,对于评估不同数据集的模型性能至关重要.


