一个增强的GSNMF模型用于大量RNA-seq数据的完整解卷
Yujie Li1,2, Su Xu1, Xue Wang3
1Department of Mathematics and Statistics, University of North Carolina at Charlotte, USA.
Mathematical biosciences and engineering : MBE
|April 29, 2025
概括
这项研究解决了大量RNA-seq数据的细胞类型解卷的挑战,使用一种新的非负矩阵因子化 (NMF) 方法. 开发的管道通过增强数据和估计重新缩放矩阵以获得更好的基因表达特征和细胞丰度来提高准确性.
科学领域:
- 计算生物学 计算生物学
- 生物信息学是一种生物信息学.
- 基因组学就是基因组学.
背景情况:
- 分解大量RNA-seq数据以识别细胞类型特定的基因表达特征 (GEP) 和丰度至关重要,但具有挑战性.
- 非负矩阵分解 (NMF) 是一种常见的方法,在数学上是错误的,阻碍了准确的解决方案.
- 现有的解卷方法缺乏全面了解如何克服NMF的不良位置并提高溶液精度.
研究的目的:
- 为了研究准确的NMF-based deconvolution所需的可溶性条件.
- 开发用于估计局部最小值和重新缩放矩阵的策略,以提高NMF解决方案的独特性和准确性.
- 引入一个新的计算管道,GSNMF+,用于增强大批量RNA-seq解卷.
主要方法:
- 研究了NMF可溶性条件和重新缩放矩阵对溶液独特性的影响.
- 使用模拟细胞组合和单细胞RNA-seq (scRNAseq) 数据进行伪批量组织数据增强开发了管道.
- 实施了几何结构引导的NMF模型 (GSNMF+),包含估计的重新缩放矩阵来改进NMF解决方案.
主要成果:
- 该GSNMF+管道确保混合数据集满足NMF弱可解决性条件.
- 估计的重新缩放矩阵有效地调整NMF最小化器,减少平均平方根误差.
- 在现实的批量组织数据集上观察到解卷精度的显著改善,特别是在单独的细胞组合下.
结论:
- GSNMF+管道为NMF在散装RNA-seq解卷过程中的不良性质提供了一个强大的解决方案.
- 伪批量数据增强和重新缩放矩阵估计是改善细胞类型丰度和GEP准确性的有效策略.
- 这种方法提高了解卷分析的可靠性,特别是在复杂的生物样本中.


