从细胞形态学和化学指纹模型中合并生物活性预测,使用与训练数据相似性的化学指纹模型
Srijit Seal1, Hongbin Yang1, Maria-Anna Trapotsi1
1Yusuf Hamied Department of Chemistry, University of Cambridge, Cambridge, UK.
Journal of cheminformatics
|June 2, 2023
概括
结合化学结构和细胞形态数据的新机器学习模型改善了生物预测. 这些基于相似性的融合模型提高了准确性,并扩大了可以分析的化学化合物的范围.
科学领域:
- 计算化学和化学信息学
- 机器学习在药物发现中的作用
- 系统生物学和高内容查
背景情况:
- 预测生物活动的机器学习模型往往面临限制,因为训练数据中的化学空间多样性狭窄.
- 预测模型通常依赖于化学结构或细胞形态数据,但不能同时协同工作.
研究的目的:
- 开发和评估基于相似性的新型合并模型,将化学结构和细胞形态数据集成在一起,以提高生物终点预测.
- 从多个数据库中评估这些合并模型在多种生物测试中的表现.
主要方法:
- 开发了基于相似性的融合模型,将单个化学结构 (基于指纹) 和细胞形态 (基于细胞绘画) 模型的输出结合起来.
- 纳入测试和训练化合物之间的结构和形态相似性作为后勤回归合并模型中的特征.
- 应用模型来预测测定量,来自ChEMBL,PubChem和Broad Institute的177项测量.
主要成果:
- 基于相似性的合并模型表现出卓越的性能,在177个测试中79个测试中实现曲线下的面积 (AUC) >0.70.
- 这与仅依赖化学结构 (65个测试) 或细胞绘画数据 (50个测试) 的模型相比,是一个显著的改进.
- 合并模型成功地扩大了适用范围,显示出更好的推断到新的结构和形态空间.
结论:
- 通过基于相似性的融合模型整合化学结构和细胞形态数据,可以显著提高生物测试结果预测的准确性.
- 这些混合模型为药物发现和化学生物学研究提供了更强大,更广泛的应用方法.
- 开发的方法有效地克服了与单一数据类型预测模型相关的局限性.


