在集成多个Hi-C数据集时,使用张量分解来识别常见的最佳 bin 大小的新型 AI 驱动的计算方法
1Department of Physics, Chuo University, 1-13-27 Kasuga, Bunkyo-ku, Tokyo, 112-8551, Japan. tag@granular.com.
Scientific reports
|March 3, 2025
概括
对于多个Hi-C数据集来说,选择合适的容器大小是很棘手的. 本研究引入了张量分解来自动找到最佳分辨率,使基因组相互作用数据能够更好地集成.
科学领域:
- 基因组学和生物信息学
- 计算生物学 计算生物学
- 系统生物学 系统生物学
背景情况:
- 集成多个Hi-C数据集需要一个共同的容器大小,这是一个挑战,因为数据集质量随分辨率而变化.
- 确定最佳 bin 尺寸对于准确识别 Hi-C 数据中常见的结构特征至关重要.
- 现有的质量评估在选择适用于各种Hi-C数据集的单一最佳 bin 尺寸方面存在局限性.
研究的目的:
- 提出一种用于选择最佳容器大小的新方法,用于集成多个Hi-C数据集.
- 为了实现对多数据集Hi-C分析的最高分辨率的自动实证估计.
- 克服手动值设定和特定数据集质量评估的局限性.
主要方法:
- 张量分解 (TD) 的应用,用于无监督特征提取 (FE).
- 利用基于TD的FE中观察到的相位过渡类现象来确定最佳的容器大小.
- 从GEO (GEO ID: GSE260760, GSE255264) 获取的Hi-C数据集的分析.
主要成果:
- 拟议的基于TD的无监督FE方法自动估计尽可能最小的 bin 尺寸 (最高分辨率).
- 这种方法在经验上确定了最佳分辨率,而不需要调整的参数.
- 证明了在多个Hi-C配置文件中优化垃圾桶大小的能力.
结论:
- 张量分解提供了一个强大的,无参数的方法,用于优化多数据集Hi-C集成中的 bin 大小.
- 这种技术可以更准确地识别跨数据集的常见基因组结构.
- 代表了分析和整合Hi-C数据的新进展.
更多相关视频
12:27Large-scale Reconstructions and Independent, Unbiased Clustering Based on Morphological Metrics to Classify Neurons in Selective Populations
Published on: February 15, 2017
6.9K
05:12ExCYT: A Graphical User Interface for Streamlining Analysis of High-Dimensional Cytometry Data
Published on: January 16, 2019
11.3K
