长读总和 (LongReadSum):一个快速灵活的质量控制和信号总结工具,用于长读测序数据
bioRxiv : the preprint server for biology
|August 30, 2024
概括
LongReadSum为跨多个平台的长读序列数据提供快速,全面的质量控制. 这个新工具解决了现有软件的局限性,为各种基因组应用提供了关键指标.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 目前用于测序数据的质量控制 (QC) 工具主要集中在短读数上,长读数的选择有限.
- 目前的长读质量控制工具缺乏全面的指标,跨平台兼容性 (PacBio,牛津纳米孔,Illumina完整长读),以及对各种数据格式的支持 (ONT POD5,FAST5,PacBio BAM).
- 需要工具可以处理来自像牛津纳米孔PromethION这样的平台的大数据量,并提供特定的见解,如基调信号和甲基化信息.
研究的目的:
- 开发一个快速的,多线程的计算工具,LongReadSum,用于对长读序列数据的全面质量控制.
- 通过支持多个测序平台和数据格式来解决现有工具的局限性.
- 提供先进的QC功能,包括基调信号强度和基调修饰 (甲基化) 分析.
主要方法:
- 开发了LongReadSum作为一个多线程C++应用程序.
- 集成支持主要的长读测序平台 (PacBio,牛津纳米孔,Illumina完整长读) 和数据格式 (ONT POD5,FAST5,PacBio BAM).
- 实施了QC指标,涵盖读取长度,基质,对齐,基调修改和牛津纳米孔基调信号强度.
主要成果:
- LongReadSum为长读序列数据提供快速和全面的QC报告.
- 该工具成功分析了各种数据类型,包括cDNA,直接mRNA,减少表示甲基化测序 (RRMS) 和全基因组测序 (WGS).
- 证明了处理大型数据集的能力,例如由牛津纳米孔PromethION流细胞生成的数据集.
结论:
- LongReadSum有效地解决了对长读序列的强大和高效质量控制的需求.
- 该工具增强了跨各种长期阅读平台和应用程序的数据分析,包括甲基化分析.
- 这为研究人员提供了宝贵的资源,他们从下一代测序技术中处理大规模基因组数据.


