解码不一致的生物数据:在药物发现中实现增强人工智能预测能力的关键步骤
Mira A M Behnam1, Andrea Cavalli2, Diana Lousa3
1Medicinal Chemistry, Institute of Pharmacy and Molecular Biotechnology, Heidelberg University, Im Neuenheimer Feld 364, Heidelberg 69120, Germany.
ACS pharmacology & translational science
|January 15, 2026
概括
来自不同来源的生物活性数据的结合在机器学习 (ML) 模型中引入噪音. 解决测试协议变异对于准确的计算药物发现和蛋白质-连接体相互作用研究至关重要.
科学领域:
- 计算化学是一种计算化学.
- 药物发现 药物发现
- 生物化学 生物化学
背景情况:
- 来自不同来源的生物活性数据的结合为机器学习 (ML) 模型引入了噪音.
- 测试协议的变化 (缓冲组合,实验设置) 显著影响数据可靠性.
- 酶和病毒表面蛋白质等蛋白质点表现出受外部因素影响的结构变化.
研究的目的:
- 突出测试方案变化的对生物活性数据的影响.
- 讨论在计算药物发现中减轻噪音的策略.
- 探索深度学习 (DL) 和大型语言模型 (LLM) 在应对这些挑战方面的潜力.
主要方法:
- 分析测试方案的变化及其对蛋白质标的影响.
- 对处理酶抑制剂/结合剂数据的策略的审查.
- 讨论深度学习 (DL) 模型的实用性.
- 探索当前计算蛋白质-连接体相互作用研究的局限性.
- 专家采访大语言模型 (LLM) 和代理人工智能.
主要成果:
- 测试协议的差异是生物活性数据集中噪声的主要来源.
- 酶和病毒蛋白的形态变化使数据集成复杂化.
- 深度学习 (DL) 模型看起来有前途,但也有局限性.
- LLM和代理AI为药物发现提供了潜在的进步.
结论:
- 标准化测试协议对于可靠的ML模型培训在药物发现中至关重要.
- 需要先进的计算方法,包括DL和LLM,以克服数据异质性.
- 需要进一步的研究才能充分利用人工智能来预测蛋白质-连接体相互作用.


