基准数据集用于训练机器学习模型,以预测代谢物的途径参与
Erik D Huckvale1, Christian D Powell1,2,3, Huan Jin4
1Department of Computer Science (Data Science Program), University of Kentucky, Lexington, KY 40506, USA.
bioRxiv : the preprint server for biology
|October 24, 2023
概括
本研究引入了一套新的,经过验证的数据集,用于使用机器学习来预测代谢途径的参与. XGBoost模型实现了最佳性能,改善了代谢途径的解释.
科学领域:
- 生物化学和生物信息学
- 计算生物学 计算生物学
- 代谢学 代谢学 代谢学
背景情况:
- 代谢途径分析对于理解生化过程至关重要,但许多已识别的代谢物在公共数据集中缺乏定义的途径参与.
- 目前用于预测代谢途径参与的机器学习模型依赖于过时和有缺陷的数据集,阻碍了准确的代谢解释.
- 基因和基因组的京都百科全书 (KEGG) 是一个关键的资源,但其代谢物数据需要严格的策划用于计算应用.
结论:
- 开发的数据集和XGBoost模型显著提高了预测代谢物途径参与的准确性.
- 这项工作为推进代谢途径的解释和发现提供了一个强大的计算框架.
- 通过将未知的代谢物分配到它们各自的途径,更好地了解代谢网络.


