Related Experiment Video
Updated: Apr 7, 2026

Rup (RNA-seq Usability Assessment Pipeline) - Quality Control for Bulk RNA-seq Experiments in Eukaryotes
Published on: November 7, 2025
Assessing Dissimilarity Measures for Sample-Based Hierarchical Clustering of RNA Sequencing Data Using Plasmode
Pablo D Reeb1, Sergio J Bramardi2, Juan P Steibel3
1Department of Fisheries and Wildlife, Michigan State University, East Lansing, Michigan, United States of America; Department of Statistics, Universidad Nacional del Comahue, Cinco Saltos, Rio Negro, Argentina.
Hierarchical clustering of RNA sequencing (RNA-seq) data requires appropriate dissimilarity measures. Plasmode datasets reveal that Poisson-based or rank correlation dissimilarities, alongside proper data transformation, reliably capture RNA-seq data structures.
Area of Science:
- Bioinformatics
- Computational Biology
- Statistical Genetics
Background:
- Hierarchical clustering is vital for analyzing high-throughput gene expression data.
- RNA sequencing (RNA-seq) data presents unique challenges for clustering due to discrete, over-dispersed, and skewed read counts, plus sequencing depth variations.
- Existing methods for assessing dissimilarity measures, like parametric simulations, may offer limited scope.
Purpose of the Study:
- To evaluate the adequacy of various dissimilarity measures for sample-based hierarchical clustering of RNA-seq data.
- To introduce plasmode datasets as a robust method for simulating realistic RNA-seq experimental conditions.
- To identify reliable dissimilarity measures that accurately reflect hierarchical structures in RNA-seq data.
Main Methods:
- Generation of plasmode datasets simulating realistic RNA-seq data characteristics and experimental conditions.
- Assessment of multiple dissimilarity measures, including Euclidean-based, Poisson-based, and rank correlation-based methods.
- Comparison of clustering results against expected hierarchical structures derived from plasmode data.
Main Results:
- Dissimilarity measures relying solely on normalization or standardization of Euclidean distance were unreliable.
- Poisson-based dissimilarity, rank correlation-based dissimilarity, and appropriate data transformations yielded dendrograms consistent with expected structures.
- Plasmode datasets generated from diverse RNA-seq experiments yielded consistent results, validating their utility.
Conclusions:
- Plasmode datasets provide a powerful and flexible approach for evaluating dissimilarity measures in RNA-seq hierarchical clustering.
- Effective dissimilarity measures for RNA-seq data include Poisson-based, rank correlation-based, and those employing appropriate data transformations.
- The choice of a specific measure may depend on software availability within a given analysis pipeline.
More Related Videos
04:58Author Spotlight: Investigating the Role of Repetitive DNA Misregulation in Cancer Initiation and Immunotherapy Resistance
Published on: December 13, 2024
10:50Detection and Quantification of Plasmodium falciparum in Aqueous Red Blood Cells by Attenuated Total Reflection Infrared Spectroscopy and Multivariate Data Analysis
Published on: November 2, 2018
Related Concept Videos
Evolutionary Relationships through Genome Comparisons
RNA-seq
Before the discovery of RNA-seq, microarray-based methods and Sanger sequencing were used for transcriptome analysis. However, while...