一个用于从SRA癌症数据中提取生物见解的计算框架
Paul Anderson Souza Guimarães1,2, Maria Gabriela Reis Carvalho3,4, Jeronimo Conceição Ruiz5,6
1Grupo Informática de Biossistemas, Bioengenharia e Genômica, Instituto René Rachou, Fiocruz Minas, Av. Augusto de Lima, 1715, Barro Preto, Belo Horizonte, MG, Brazil.
Scientific reports
|March 8, 2025
概括
本研究介绍了一种计算方法,用于整合多样化的生物数据,以提高生物标志物发现. 它有效地从公共数据库中分组样本,帮助结直肠癌和急性淋巴细胞白血病的研究.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组学就是基因组学.
背景情况:
- 整合公共领域数据,如序列读取档案 (SRA),可以增加生物信息分析的样本大小.
- 数据挖掘和样本分组的挑战包括各种数据格式,缺失的数据和不一致的实验方法.
研究的目的:
- 开发一种计算方法,以克服生物标志物研究中的数据挖掘和样本分组挑战.
- 为了发现潜在的癌症生物标志物的样本收集之间的关系.
主要方法:
- 一种结合关系数据库构建,文本和数据挖掘以及自然语言处理的计算方法.
- 使用网络分析和搜索PubMed出版物,结合MeSH,TTD和WordNet数据库.
- 导航SRA元数据以检索,提取和整合结直肠癌 (CRC) 和急性淋巴细胞白血病 (ALL) 的数据.
主要成果:
- 该方法有效地识别和说明样本收集之间的关系.
- 突出显示了样本和患者临床数据之间的显著联系,揭示了生物学见解.
- 成功将2,737个CRC和3,655个ALL样本分组为潜在的比较组.
结论:
- 拟议的方法有助于识别各种生物样本之间的关系.
- 这种方法通过有效地整合来自公共存储库的数据来增强生物标志物发现的力量.


