简单的工具,快速评估多重复合单细胞蛋白质组学数据的质量
Conor Jenkins1, Benjamin C Orsburn2
1The University of Maryland, College Park, Maryland 20737, United States.
Journal of the American Society for Mass Spectrometry
|November 22, 2023
概括
一个新的Python工具,DIDAR,在处理之前评估单细胞蛋白质组学数据质量. 它可以识别质量差的样本并减少数据大小,节省分析时间并提高大数据集的效率.
科学领域:
- 蛋白质组学是指蛋白质组学.
- 质谱测量质量谱测量
- 生物信息学是一种生物信息学.
背景情况:
- 由于改善的质谱和样本准备,单细胞蛋白质组学正在迅速发展.
- 串联质量标签使得高通量多重复合能够分析成千上万个单细胞.
- 来自单细胞蛋白质组学的大型数据集可能由于实验损失而包含质量差的数据.
研究的目的:
- 在广泛的数据处理之前开发一个工具来评估单细胞蛋白质组学中的数据质量.
- 在工作流程的早期识别和过低质量的单细胞样本.
- 通过减少过度零值的光谱数量来加速数据处理.
主要方法:
- 开发了一个轻量级的Python脚本和图形用户界面 (GUI),名为DIDAR.
- 在MS/MS频谱内量化报告离子峰值,以评估数据质量.
- 创建缩小的MGF文件,只包含带有用户指定的记者离子数量的光谱.
主要成果:
- 迪达可以快速量化报告者离子峰值,从而识别低于质量值的样品.
- 汇总报告有助于减少对质量差的数据浪费的分析时间.
- 减少MGF文件加快下游处理速度,数据完整性损失最小.
结论:
- 迪达为单细胞蛋白质组学工作流程提供了关键的质量控制步骤.
- 该工具通过过低质量的数据和减少文件大小来提高效率.
- 迪达与所有现代操作系统兼容,可通过GitHub访问.


