通过低N选择和验证机器学习,通过精确的顶级蛋白质变体发现
Hoi Yee Chu1, John H C Fong2, Dawn G L Thean2
1Laboratory of Combinatorial Genetics and Synthetic Biology, School of Biomedical Sciences, The University of Hong Kong, Pokfulam, Hong Kong SAR, China; Centre for Oncology and Immunology, Hong Kong Science Park, Hong Kong SAR, China.
Cell systems
|February 10, 2024
概括
这项研究介绍了用于蛋白质工程的机器学习策略,有效地识别了在最小的实验中高性能变体. 该方法使用主动学习来促进资源生产和蛋白质设计.
科学领域:
- 蛋白质工程是指蛋白质工程.
- 机器学习 机器学习
- 计算生物学 计算生物学
背景情况:
- 优化蛋白质变体对于生物技术至关重要.
- 庞大的组合景观带来了实验挑战.
- 有效地识别高性能突变物需要先进的策略.
研究的目的:
- 开发一种基于机器学习的策略,用于高效的蛋白质变体选择.
- 为了最大限度地减少识别表现最佳的蛋白质变体的实验力度.
- 为了提高蛋白质工程中的资源生产能力.
主要方法:
- 整合零射击预测与多轮主动学习.
- 在实验设计中采用低N选择和验证采样.
- 使用机器学习来预测和选择顶级变体.
主要成果:
- 在选择前1%的变体中,达到高达92.6%的准确性.
- 在四轮12种变体采样中证明了有效性.
- 在两轮24个变体采样中显示了可比的结果.
结论:
- 拟议的策略在发现蛋白质变异方面优于现有的方法.
- 在基于CRISPR的基因组编辑器中成功识别了高性能变体.
- 这种方法可用于各种蛋白质工程任务.


