Related Experiment Video
Updated: May 24, 2025

Selecting Multiple Biomarker Subsets with Similarly Effective Binary Classification Performances
Published on: October 11, 2018
Novel AI-powered computational method using tensor decomposition for identification of common optimal bin sizes when
1Department of Physics, Chuo University, 1-13-27 Kasuga, Bunkyo-ku, Tokyo, 112-8551, Japan. tag@granular.com.
Choosing the right bin size for multiple Hi-C datasets is tricky. This study introduces tensor decomposition for automatically finding the optimal resolution, enabling better integration of genomic interaction data.
Area of Science:
- Genomics and Bioinformatics
- Computational Biology
- Systems Biology
Background:
- Integrating multiple Hi-C datasets requires a common bin size, which is challenging as dataset quality varies with resolution.
- Determining optimal bin sizes is crucial for accurately identifying common structural features in Hi-C data.
- Existing quality assessments have limitations in selecting a single optimal bin size applicable across diverse Hi-C datasets.
Purpose of the Study:
- To propose a novel method for selecting optimal bin sizes for integrating multiple Hi-C datasets.
- To enable automatic empirical estimation of the highest resolution for multi-dataset Hi-C analysis.
- To overcome the limitations of manual threshold setting and dataset-specific quality assessments.
Main Methods:
- Application of tensor decomposition (TD) for unsupervised feature extraction (FE).
- Utilizing phase transition-like phenomena observed in TD-based FE to identify optimal bin sizes.
- Analysis of Hi-C datasets retrieved from GEO (GEO IDs: GSE260760, GSE255264).
Main Results:
- The proposed TD-based unsupervised FE method automatically estimates the smallest possible bin size (highest resolution).
- This approach empirically determines the optimal resolution without requiring tunable parameters.
- Demonstrated ability to optimize bin sizes across multiple Hi-C profiles.
Conclusions:
- Tensor decomposition provides a robust, parameter-free method for optimizing bin sizes in multi-dataset Hi-C integration.
- This technique facilitates more accurate identification of common genomic structures across datasets.
- Represents a novel advancement in analyzing and integrating Hi-C data.
More Related Videos
12:27Large-scale Reconstructions and Independent, Unbiased Clustering Based on Morphological Metrics to Classify Neurons in Selective Populations
Published on: February 15, 2017
05:12ExCYT: A Graphical User Interface for Streamlining Analysis of High-Dimensional Cytometry Data
Published on: January 16, 2019