用自定义分区逻辑修改的决策树提高了对多个大脑阿尔茨海默病蛋白质组数据集的概括性
Mark V Ivanov1, Anna S Kopeykina1, Elizaveta M Kazakova1
1V. L. Talrose Institute for Energy Problems of Chemical Physics, N. N. Semenov Federal Research Center for Chemical Physics, Russian Academy of Sciences, Moscow 119334, Russia.
Journal of proteome research
|February 21, 2025
概括
一个新的机器学习工作流提高了蛋白质组学数据分析的概括性. 这种方法确定了七种蛋白质,包括TRFE和APEX1,在无症状阿尔茨海默病患者中独特表达,这可能解释了痴呆症的缺失.
科学领域:
- 蛋白质组学是指蛋白质组学.
- 生物信息学是一种生物信息学.
- 神经科学是一个神经科学.
背景情况:
- 在发现蛋白质组学中发现的概括性通常受到患者队列差异和实验变异的限制.
- 现有的蛋白质组学数据分析工作流很难在多个数据集中整合和概括发现.
研究的目的:
- 开发和验证基于机器学习的工作流程,以提高蛋白质组学数据分析在不同数据集中的通用性.
- 为了识别具有表达模式独特的无症状阿尔茨海默病患者的蛋白质.
主要方法:
- 定制了一个具有新参数 (min_groups_leaf) 的决策树模型,以调节模型叶中的每个数据集的样本表示.
- 分析特征重要性趋势作为基于蛋白质的特征选择新参数的函数.
- 测试了5个阿尔茨海默病死后人类大脑蛋白质组数据集 (535个LC-MS/MS文件) 的工作流程,使用MS1-only和MS/MS-based处理管道.
主要成果:
- 开发的工作流程成功地提高了基于蛋白质的特征选择概括性.
- 在无症状阿尔茨海默氏症患者中确定了7种具有独特表达模式的蛋白质.
- 血清转移激素 (TRFE) 和DNA修复核酶APEX1被强调在预防痴呆症方面具有潜在意义,尽管阿尔茨海默氏症的病理学.
结论:
- 机器学习工作流提高了蛋白质组学发现的概括性,特别是在像阿尔茨海默氏症这样的复杂疾病研究中.
- TRFE和APEX1代表了理解阿尔茨海默病认知性的有希望的生物标志物.


