Related Experiment Video
Updated: May 23, 2025

Performing Data Mining And Integrative Analysis Of Biomarker in Breast Cancer Using Multiple Publicly Accessible Databases
Published on: May 17, 2019
A computational framework for extracting biological insights from SRA cancer data
Paul Anderson Souza Guimarães1,2, Maria Gabriela Reis Carvalho3,4, Jeronimo Conceição Ruiz5,6
1Grupo Informática de Biossistemas, Bioengenharia e Genômica, Instituto René Rachou, Fiocruz Minas, Av. Augusto de Lima, 1715, Barro Preto, Belo Horizonte, MG, Brazil.
This study introduces a computational method to integrate diverse biological data for enhanced biomarker discovery. It effectively groups samples from public databases, aiding research in colorectal cancer and acute lymphoblastic leukemia.
Area of Science:
- Bioinformatics
- Computational Biology
- Genomics
Background:
- Integrating public domain data like The Sequence Read Archive (SRA) can increase sample sizes for bioinformatic analysis.
- Challenges in data mining and sample grouping include varied data formats, missing data, and inconsistent experimental methods.
Purpose of the Study:
- To develop a computational methodology for overcoming data mining and sample grouping challenges in biomarker research.
- To identify relationships among sample collections for discovering potential cancer biomarkers.
Main Methods:
- A computational approach integrating relational database construction, text and data mining, and natural language processing.
- Utilizing network analysis and searching PubMed publications, combined with MeSH, TTD, and WordNet databases.
- Navigating SRA metadata to retrieve, extract, and integrate data for colorectal cancer (CRC) and acute lymphoblastic leukemia (ALL).
Main Results:
- The methodology effectively identifies and illustrates relationships among sample collections.
- Significant connections between samples and patient clinical data were highlighted, revealing biological insights.
- Successfully grouped 2,737 CRC and 3,655 ALL samples into potential comparison groups.
Conclusions:
- The proposed method aids in identifying relationships among diverse biological samples.
- This approach enhances the power of biomarker discovery by effectively integrating data from public repositories.

