一个MSstats工作流程用于检测差异丰富的蛋白质在大规模的数据独立采集质谱实验与FragPipe处理
Devon Kohler1,2, Mateusz Staniak3, Fengchao Yu4
1Khoury College of Computer Sciences, Northeastern University, Boston, MA, USA.
Nature protocols
|May 20, 2024
概括
新的MSstats软件处理来自数据独立获取 (DIA) 实验的大型蛋白质组数据集. MSstatsBig和MSstatsShiny为研究人员提供高效的分析,即使计算资源有限.
科学领域:
- 蛋白质组学是指蛋白质组学
- 计算生物学 计算生物学
- 质谱测量质量谱测量
背景情况:
- 质谱学的进步使得更大,更复杂的蛋白质组学实验成为可能.
- 下一代数据独立采集 (DIA) 提供了更广泛的蛋白质组覆盖范围,但产生了大量的数据集.
- 现有的统计工具难以应对DIA数据的规模和复杂性.
研究的目的:
- 为了呈现MSstats的更新版本,与大规模的DIA实验兼容.
- 为大型DIA数据集展示高效的数据分析工作流程.
- 为不同的计算资源提供选项,包括用于内存密集型任务的MSstatsBig.
主要方法:
- 调整MSstats用于大规模的DIA数据处理.
- 使用FragPipe处理的大型DIA实验进行演示.
- 对于超过标准内存容量的数据集,使用MSstatsBig R包.
- 通过MSstatsShiny图形用户界面或R编码实现.
主要成果:
- 更新后的MSstats协议有效处理大规模的DIA数据集.
- MSstatsBig允许对数据集进行分析,这些数据集对于标准计算机内存来说太大了.
- 分析时间可控 (1-3小时),受MSstatsBig使用的影响.
- 突出显示了影响结果和处理时间的关键决策.
结论:
- 增强的MSstats协议成功地解决了分析大规模DIA蛋白质组学数据的挑战.
- MSstatsBig和MSstatsShiny为研究人员提供灵活和高效的解决方案.
- 该协议有助于在复杂的蛋白质组学研究中进行可靠的统计比较.


