ARA:一个灵活的管道,用于NCBI SRA数据集的自动探索
Anand Maurya1, Maciej Szymanski1, Wojciech M Karlowski1
1Department of Computational Biology, Institute of Molecular Biology and Biotechnology, Faculty of Biology, Adam Mickiewicz University in Poznan, Uniwersytetu Poznanskiego 6, 61-614 Poznan, Poland.
GigaScience
|August 17, 2023
概括
本研究引入了一个自动化管道,用于高效地探索NCBI序列阅读档案 (SRA) 数据库. 该工具可以对下一代测序 (NGS) 数据进行基于序列的搜索,从而提高生物数据库的可访问性.
科学领域:
- 生物信息学是一种生物信息学.
- 基因组学就是基因组学.
- 计算生物学 计算生物学
背景情况:
- 探索生物数据库,如NCBI序列读取档案 (SRA) 对于研究至关重要.
- 传统的基于序列的搜索受到下一代测序 (NGS) 的大量数据的阻碍.
- 目前的SRA记录组织倾向于浏览和元数据搜索,限制了有效的探索.
研究的目的:
- 开发一个自动化管道,以加强对NCBI SRA数据库记录的探索.
- 为了能够在SRA中有效地采样和分析NGS数据.
- 为访问和查询SRA信息提供一个用户友好的工具.
主要方法:
- 开发了一个自动化管道,集成已建立的NGS数据处理工具.
- 实施了一种方法来探测SRA记录序列中的一部分以匹配内容.
- 设计用于自动设置和操作,具有模块化可扩展性.
主要成果:
- 该管道允许使用查询核酸序列有效采样NCBI SRA数据库记录.
- 它通过分析用户定义的一小部分序列来估计匹配的SRA连接.
- 根据用户定义的标准进行完整的映射实验.
结论:
- 介绍了一个自动化,易于操作的工具,用于访问和探索NCBI SRA数据库记录.
- 扩大用户查询和分析大规模NGS数据的能力.
- 提高SRA内部信息的可发现性和实用性.


