模拟设计-构建-测试-学习周期,用于在代谢工程中一致比较机器学习方法
Paul van Lent1, Joep Schmitz2, Thomas Abeel1,3
1Delft Bioinformatics Lab, Delft University of Technology Van Mourik, Delft 2628 XE, The Netherlands.
ACS synthetic biology
|August 24, 2023
概括
机器学习有助于通过代设计-构建-测试-学习循环优化代谢流量. 一个新的框架显示梯度增强和随机森林模型在低数据场景中表现出色,改善了菌株的发展.
科学领域:
- 代谢工程和合成生物学
- 计算生物学和生物信息学
- 机器学习在生物技术中的应用
背景情况:
- 组合性路径优化对于代谢流量优化至关重要,但面临着许多基因的组合性爆炸.
- 代设计-构建-测试-学习 (DBTL) 周期通常用于菌株优化,旨在增量产品菌株开发.
- 对代DBTL循环的机器学习 (ML) 方法的评估是具有挑战性的,因为缺乏标准化的测试框架.
研究的目的:
- 提出和验证一个基于机械运动模型的框架,用于测试和优化ML在代组合路径优化.
- 评估各种ML模型在DBTL循环中对应变优化的性能.
- 在有限的应变构造预算内,开发一种基于ML预测的推新设计的算法.
主要方法:
- 开发了一个基于机械动力学模型的框架,用于模拟和评估多个DBTL周期的ML性能.
- 在低数据条件下测试和比较各种ML算法,包括梯度增强和随机森林.
- 引入了一个设计推算法,利用ML模型预测进行高效的菌株选择.
主要成果:
- 梯度增强和随机森林模型在低数据模式下,与其他ML方法相比,表现优越.
- 这些强大的ML模型被证明能够抵御训练集偏差和生物数据中固有的实验噪声.
- 该研究发现,当可构造菌株的数量有限时,以更大的初始DBTL周期启动更有利.
结论:
- 拟议的框架为评估和优化ML用于代菌株开发提供了一个强大的方法.
- 梯度增强和随机森林是有效的ML选择低数据,在代谢工程中的杂环境.
- 战略性的DBTL循环设计,特别是较大的初始循环,可以提高应变优化工作的效率.


