机器学习对调整特征进行模拟混合RNA-seqq的原始原始分类
Jason R Miller1,2,3, Donald A Adjeroh4
1Department of Computer Science, Mathematics, Engineering, Shepherd University, Shepherdstown, WV, USA. jmill02@shepherd.edu.
BMC bioinformatics
|March 13, 2024
概括
机器学习改善了跨物种杂交物种中RNA-seq读取的原始原始分类. 这通过纠正对齐错误来提高异位基因特异性基因表达 (ASE) 检测准确性.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 源代基因特定基因表达 (ASE) 可以通过RNA测序 (RNA-seq) 在物种间杂交中检测到.
- 差异表达分析 (DEA) 依赖于RNA-seq读数与父母引用的准确对齐,但当前的对齐器通常会错误地分配读数.
- 这种错误分配阻碍了在杂交生物体中准确检测ASE.
研究的目的:
- 开发和评估一种机器学习方法,以提高分配RNA-seq读数到其正确的家长引用的准确性.
- 为了提高对跨物种杂交物种等位基因特异性基因表达分析的可靠性.
主要方法:
- 利用已知杂交物种的公开RNA-seq数据.
- 评估现有软件包在赋值阅读到家长引用的性能.
- 开发了一种新的机器学习后处理方法,使用在对齐特征上训练的随机森林分类器.
- 评估后处理器在模拟混合数据集上将读数分配到正确的原始源代码的准确性.
主要成果:
- 标准的RNA-seq对齐软件经常偏爱错误的物种引用,导致错误分类.
- 与单独调整器相比,开发的机器学习后处理器显著提高了将RNA-seq读取对分配到正确的源代对的准确性.
- 后处理器在模拟的混合数据集上显示出更高的准确性.
结论:
- 机器学习提供了一种强大的方法来提高基于对齐的方法的准确性,用于RNA-seq数据中的原始源分类.
- 这种方法有望改善在物种间杂交物种中对等位基因特异性基因表达的检测.
- 这代表了机器学习对混合系统中ASE检测问题的新应用.
更多相关视频
11:04RNA Next-Generation Sequencing and a Bioinformatics Pipeline to Identify Expressed LINE-1s at the Locus-Specific Level
Published on: May 19, 2019
9.9K
10:44Low-input Nucleus Isolation and Multiplexing with Barcoded Antibodies of Mouse Sympathetic Ganglia for Single-nucleus RNA Sequencing
Published on: March 23, 2022
4.2K
