基于深度学习的Hi-C分辨率改进方法的普遍性全面评估
Ghulam Murtaza1, Atishay Jain1, Madeline Hughes1
1Department of Computer Science, Brown University, Providence, RI 02912, USA.
Genes
|January 23, 2024
概括
现有的深度学习方法用于升级Hi-C数据,与现实世界的稀疏数据集作斗争. 重新训练可以提高表现,但无法完全恢复染色体循环和TADs等基因组特征.
科学领域:
- 基因组学就是基因组学.
- 计算生物学 计算生物学
- 生物信息学是一种生物信息学.
背景情况:
- Hi-C对于研究3D基因组组织至关重要,但粗略的分辨率限制了分析.
- 升级方法旨在提高Hi-C数据分辨率,但它们在现实世界中的应用性尚不清楚.
研究的目的:
- 综合评估现有的基于深度学习的Hi-C升级方法.
- 评估这些方法在实验生成的稀疏Hi-C数据集上的通用性.
- 确定局限性,并为未来的深度学习方法提出改进建议.
主要方法:
- 开发了Hi-CY框架,用于比较Hi-C升级方法.
- 评估了七种多样化,实验生成的稀疏Hi-C数据集的方法,跨越三个细胞系.
- 使用多个指标和下游任务 (如TAD和染色素循环回忆) 评估性能.
主要成果:
- 现有的深度学习方法在稀疏的数据集上显示了高达57%的性能下降.
- 使用实验数据的再培训方法提高了高达31%的性能.
- 即使经过再培训,方法也很难准确地恢复生物特征,如染色体循环和TADs.
结论:
- 当前的深度学习Hi-C升级方法缺乏对现实世界稀疏数据的概括性.
- 实验数据对于培训和验证这些方法至关重要.
- 需要进一步的研究,以改善微型基因组结构的恢复.


