训练机器学习模型的基准数据集,以预测代谢物的途径参与
Erik D Huckvale1,2, Christian D Powell1,2,3, Huan Jin4
1Markey Cancer Center, University of Kentucky, Lexington, KY 40506, USA.
Metabolites
|November 24, 2023
概括
这项研究引入了一个新的,可靠的数据集,用于使用机器学习来预测代谢途径的参与. XGBoost模型实现了最佳性能,改善了代谢途径的解释.
科学领域:
- 生物化学 生物化学
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 代谢途径对于理解生化反应至关重要,但许多已识别的代谢物在公共数据集中缺乏定义的途径参与.
- 现有的机器学习模型用于代谢途径预测,依赖于过时和有缺陷的数据集,阻碍了准确的代谢解释.
研究的目的:
- 利用基因和基因组京都百科全书 (KEGG) 的数据开发一个强大的,可重复的基准数据集,用于代谢途径预测.
- 评估和比较机器学习模型的性能,包括随机森林,XGBoost和带有自动编码器的多层感知子,用于预测代谢物途径参与.
主要方法:
- 从KEGG生成了一个新的基准数据集,遵守计算可重现性标准,包括可更新的源代码.
- 在新数据集上采用原子染色方法和训练机器学习模型 (随机森林,XGBoost,带自动编码器的MLP).
- 使用1000个独特的交叉验证折叠来评估模型性能.
主要成果:
- XGBoost二元分类模型在预测参与11个KEGG定义的途径类别方面表现出卓越的表现.
- 获得了0.8180的最佳整体加权平均F1得分和0.7933.33的马修斯相关系数.
- 新的基准数据集和方法提供了可靠的资源,用于预测代谢途径.
结论:
- 开发的基准数据集和XGBoost模型显著提高了预测代谢途径参与的准确性.
- 这项工作解决了先前研究的局限性,为代谢途径分析提供了可重复和最新的资源.
- 预测准确度的提高有助于更深入地了解代谢网络和生化过程.


