调查用于可概括抗体-抗原 ΔΔG 预测所需的数据的数量和多样性
Alissa M Hummer1, Constantin Schneider2, Lewis Chinery2
1Department of Statistics, University of Oxford, Oxford, UK. contact@alissahummer.com.
Nature computational science
|July 8, 2025
概括
使用Graphinity预测抗体-抗原结合亲和力 (ΔΔG) 是有前途的,但需要更多多样化的实验数据. 目前的数据集不足以进行可靠,可概括的预测,突出显示需要更大,更多样化的数据收集.
科学领域:
- 计算生物学是一种计算生物学.
- 生物物理学的生物物理.
- 机器学习在药物发现中的作用
背景情况:
- 抗体与抗原的结合亲和力对于治疗抗体的有效性至关重要.
- 准确预测结合亲和力变化 (ΔΔG) 对于合理的药物设计至关重要.
研究的目的:
- 评估Graphinity的性能,一个等价图形神经网络,用于预测抗体-抗原结合亲和力.
- 调查数据集大小和多样性对 ΔΔG 预测模型概括性的影响.
- 为了确定可靠的 ΔΔG 预测的数据要求.
主要方法:
- 开发了Graphinity,一个图形神经网络模型,使用抗体-抗原结构.
- 在实验 ΔΔG 数据上训练并测试 Graphinity.
- 使用FoldX和Rosetta Flex ddG生成大型合成数据集进行进一步分析.
- 评估模型的性能和稳定性与列车测试分割变化相比.
主要成果:
- 图形性在实验 ΔΔG 预测上实现了高达 0.87 的皮尔森相关性.
- 该模型表现出过度训练的迹象,表明实验数据不足.
- 对合成数据的分析表明,为了进行可靠的预测,需要更多的数据.
- 发现数据集的多样性和数据的大小对于模型的预测性同样重要.
结论:
- 目前的实验数据集不足以训练可概括的ΔΔG预测模型.
- 需要大幅增加实验数据的数量和多样性.
- 结果为未来的数据收集和治疗抗体设计模型开发奠定了基础.


