Benchmarking component choices for unpaired single cell RNA and epigenomic integration
Fnu Naqing1,2, Qiuyue Yuan2,3, Zhana Duren4
1Center for Computational Biology and Bioinformatics, Department of Medical and Molecular Genetics, Indiana University School of Medicine, Indianapolis, IN, 46202, USA.
Genome Biology
|April 16, 2026
Summary
This study benchmarks computational pipelines for integrating unpaired single-cell multi-omics data. Optimal transport and non-linear dimension reduction methods best preserve cellular neighborhoods for robust multi-omics integration.
Area of Science:
- Genomics
- Computational Biology
- Bioinformatics
Background:
- Single-cell multi-omics technologies offer deep biological insights but integrating unpaired data remains challenging.
- Existing computational methods for unpaired data integration lack systematic evaluation.
- Paired multi-omics datasets now enable rigorous benchmarking of unpaired integration pipelines.
Purpose of the Study:
- To systematically evaluate computational strategies for integrating unpaired single-cell RNA sequencing (scRNA-seq) with peak-based epigenomic (scATAC-seq, ChIP-seq) data.
- To establish a robust and generalizable computational pipeline for unpaired multi-omics integration.
- To identify optimal choices for feature linking, dimension reduction, and clustering in unpaired data integration.
Main Methods:
- Leveraged paired scRNA-seq, scATAC-seq, and ChIP-seq datasets for systematic evaluation.
- Benchmarked individual integration steps (feature linking, dimension reduction, clustering) and their combinations.
- Assessed performance using metrics relevant to preserving cellular neighborhoods and molecular dynamics.
Main Results:
- Gene activity scores showed limited correlation with gene expression but effectively preserved cellular neighborhoods for clustering.
- Dimension reduction was the most critical step, with non-linear methods generally outperforming linear methods.
- Optimal transport (OT)-based label transfer consistently outperformed other strategies across various embeddings.
Conclusions:
- This benchmark provides crucial insights for developing robust methods for unpaired multi-omics data integration.
- Findings guide the selection of optimal computational strategies for complex multi-omics studies.
- The study facilitates a more comprehensive understanding of cell states and molecular dynamics from unpaired data.


