自动ML:研究如何构建更可靠的生物活性预测器
Raúl Fernández-Díaz1,2,3,4, Rodrigo Cossio-Pérez2,3,5, Clement Agoni2,3,6
1IBM Research, Dublin, Dublin D15 HN66, Ireland.
Bioinformatics (Oxford, England)
|September 18, 2024
概括
自动机器学习 (AutoML) 简化了构建生物活性模型. 我们的工具AutoPeptideML提供了可靠,可解释和可靠的预测,提高了研究人员的可访问性.
科学领域:
- 计算生物学是一种计算生物学.
- 机器学习是机器学习.
- 生物信息学是一种生物信息学.
背景情况:
- 自动机器学习 (AutoML) 使实验科学家能够利用先进的计算工具.
- 开发可靠的生物活性预测剂需要仔细考虑模型开发和评估步骤.
- 现有的方法可能会高估性能,因为对序列同质的处理不够.
研究的目的:
- 开发一种用于生成负数据集的自动化方法.
- 调查基于同质性的分区对模型评估的影响.
- 为了确定最佳的体表示方法和机器学习算法用于生物活性预测.
主要方法:
- 开发了一种用于负生成的自动化方法.
- 实现基于同质性的分区,以实现可靠的数据分割.
- 系统分析蛋白质语言模型用于体表示.
- 对神经网络进行评估传统的机器学习算法.
主要成果:
- 新的自动化方法提高了负生成的特异性和概括性.
- 基于同质性的分区显示,在先前的研究中,性能被高估了.
- 蛋白质语言模型提供了改进的描述器,在模型大小或类型之间没有显著差异.
- 传统的机器学习算法的集合有效地匹配神经网络的性能.
结论:
- 自动ML提供了一个可访问的AutoML解决方案,用于的生物活性预测.
- 该工具通过可靠的评估和可解释的结果提高了模型的可信度.
- 研究人员可以快速开发定制的预测模型,而无需广泛的计算专业知识.


