在测序中通过预期最大化推断蛋白质丰度推断
Javier Kipen1, Matthew Beauregard Smith2, Thomas Blom2
1Department of Intelligent Systems, Division of Information Science and Engineering, KTH Royal Institute of Technology, 114 28 Stockholm, Sweden.
Bioinformatics advances
|March 9, 2026
概括
我们开发了一种新的计算方法,从测序数据中准确量化蛋白质水平. 这种预期最大化 (EM) 框架显著改善了蛋白质丰度估计,将数据与蛋白质量化联系起来.
科学领域:
- 蛋白质组学是指蛋白质组学.
- 计算生物学 计算生物学
- 生物技术是生物技术.
背景情况:
- 测序产生数百万个读数,但缺乏用于定量蛋白质丰度估计的强有力的方法.
- 精确的蛋白质量化对于理解生物过程和疾病机制至关重要.
研究的目的:
- 从测序数据开发一个概率框架来估计相对蛋白质丰度.
- 评估拟议的全蛋白质组量化方法的可扩展性和准确性.
主要方法:
- 调整了预期最大化 (EM) 算法,以适应测序测量过程.
- 利用现有分类器的后部概率来估计蛋白质丰度.
- 使用五种蛋白质模拟和全人蛋白质模拟来评估性能.
主要成果:
- 基于EM的方法显著降低了蛋白质丰度估计的平均绝对误差,而不是统一的丰度猜测.
- 证明了可扩展性,在GPU上在不到四个小时内从人类蛋白质组模拟中处理了1000万个读数.
- 显示在当前的错误率下,准确度的增长是适度的,但在减少化学错误率时显著增加.
结论:
- 基于EM的推断提供了一个可扩展的,基于模型的解决方案,用于光测序中的蛋白质水平量化.
- 该框架可以作为其他推理方法的改进步骤.
- 测序化学的改进将直接转化为更准确的定量蛋白质组学.


