在多重空间蛋白质组学数据中对多个感兴趣区域进行统计分析
Sarah Samorodnitsky1,2, Michael C Wu1,2
1Public Health Sciences Division, Fred Hutchinson Cancer Center, Seattle, WA 98109, United States.
Briefings in bioinformatics
|October 20, 2024
概括
从多个瘤区域合成空间蛋白质组学数据是将细胞组织与患者结果联系起来的关键. 空间总结统计数据的加权平均值,考虑到每个图像的细胞数量,通常提供了最强大的方法.
科学领域:
- 计算病理学计算病理学
- 癌症研究 癌症研究
- 生物统计学 生物统计学
背景情况:
- 多复合空间蛋白质学揭示了瘤细胞的组织,影响了生存和治疗反应.
- 像里普利的K和贝萨格的L这样的空间总结统计量化了这个组织.
- 从每个患者的多张图像中合成临床终点关联的数据仍然具有挑战性.
研究的目的:
- 评估现有和新的方法,将来自多个瘤图像的空间总结统计数据与患者级临床结果联系起来.
- 确定整合多图像空间蛋白质组学数据的最有效策略.
主要方法:
- 评估基于平均值的方法 (总结统计数据的加权平均值).
- 建议和评估使用模拟随机权重和P值聚合的集合测试方法.
- 通过模拟和应用对非小细胞肺癌,结直肠癌和三阴性乳腺癌数据进行系统性绩效评估.
主要成果:
- 一个简单的加权平均总结统计数据,按每张图像的细胞数量加权,证明了高功率和有效的I型错误控制.
- 将图像区域大小变化纳入加权聚合可以在大小具有信息性时提高功率.
- 组合测试显示在各种模拟条件下具有高功率和I型错误控制.
结论:
- 多图像空间蛋白质组学数据集成的最佳策略取决于具体的数据集.
- 基于细胞计数的加权平均值是一个强大的,往往优越的方法.
- 组合测试提供了一个强大的替代方案,特别是在图像特征不同时.


