Related Experiment Video
Updated: Feb 25, 2026

05:07
Rup (RNA-seq Usability Assessment Pipeline) - Quality Control for Bulk RNA-seq Experiments in Eukaryotes
Published on: November 7, 2025
429
Clustering of RNA-Seq samples: Comparison study on cancer data
Pablo Andretta Jaskowiak1, Ivan G Costa2, Ricardo J G B Campello3
1Federal University of Santa Catarina, Joinville, Santa Catarina, Brazil.
Methods (San Diego, Calif.)
|August 6, 2017
Summary
For RNA-Seq cancer sample clustering, use gene quantification and log-transformed data. Filtering to 1,000 genes and employing Average-Linkage or k-medoids clustering with Symmetric Rank-Magnitude correlation yields optimal results.
Area of Science:
- Genomics
- Bioinformatics
- Cancer Research
Background:
- RNA-sequencing (RNA-Seq) is the standard for gene expression measurement, surpassing microarrays.
- RNA-Seq data analysis standards, especially for clustering, are underdeveloped compared to microarrays.
- Clustering is crucial for understanding gene expression patterns in cancer research.
Purpose of the Study:
- To evaluate computational strategies for clustering cancer samples using RNA-Seq data.
- To provide guidelines for practitioners on optimal RNA-Seq data clustering methods.
- To identify best practices for expression estimation, feature selection, and data transformation.
Main Methods:
- Empirical analysis of 15 mRNA-Seq cancer datasets.
- Evaluation of expression quantification strategies.
- Assessment of non-specific filtering effects on gene number.
- Comparison of data transformation techniques (e.g., log-transformation).
- Performance evaluation of four clustering algorithms (e.g., Average-Linkage, k-medoids).
- Assessment of twelve distance measures, including Symmetric Rank-Magnitude correlation.
Main Results:
- Clustering cancer samples based on gene quantification is recommended.
- Non-specific filtering to approximately 1,000 genes generally improves clustering performance.
- Log-transformation of data prior to clustering is beneficial.
- Average-Linkage and k-medoids algorithms show superior performance.
- Symmetric Rank-Magnitude correlation offers consistent results across different scenarios.
Conclusions:
- Optimal RNA-Seq cancer sample clustering involves gene quantification, log-transformation, and feature filtering.
- Average-Linkage or k-medoids algorithms combined with Symmetric Rank-Magnitude correlation are recommended.
- These findings provide practical guidelines for robust gene expression data clustering in cancer research.

