对特征选择和特征提取在高维NGS数据分析方面的进展进行了审查
Kasmika Borah1, Himanish Shekhar Das2, Soumita Seth3
1Department of Computer Science and Information Technology, Cotton University, Panbazar, Guwahati, 781001, Assam, India.
Functional & integrative genomics
|August 19, 2024
概括
来自下一代测序 (NGS) 的高维生物医学数据需要特征选择和提取. 本综述比较了分析复杂的基因组和转录组数据集的统计,机器学习和深度学习方法.
科学领域:
- 生物医学数据科学 生物医学数据科学
- 生物信息学是一种生物信息学.
- 基因组学就是基因组学.
背景情况:
- 生物医学技术的进步产生了大量的高维数据集,特别是来自下一代测序 (NGS).
- 基因组学,转录组学和蛋白质组学数据的高维度在计算负担,过拟合和解释方面提出了挑战.
- 特征选择和特征提取对于减少数据维度,提高模型性能和提高可解释性至关重要.
研究的目的:
- 对高维NGS和微阵列数据的特征选择和提取技术进行全面的比较审查.
- 探索应用于人类数据解释的统计学,机器学习和深度学习方法.
- 为应用这些技术提供见解,以增强预测模型和发现复杂数据集中的生物模式.
主要方法:
- 综合的文献搜索,重点是基于数组和下一代测序 (NGS) 数据分析.
- 基于统计,机器学习和深度学习的特征选择和提取技术的审查和比较.
- 对微阵列,散装RNA-Seq和单细胞RNA-Seq (scRNA-Seq) 数据集应用的技术的探索.
主要成果:
- 识别和分类各种特征选择和提取方法.
- 突出了在高维度NGS数据的背景下不同技术的应用,优势和局限性.
- 在各种数据类型中证明了这些方法的实用性,包括批量和单细胞RNA测序.
结论:
- 特性选择和提取对于高维度生物医学数据的有效分析至关重要.
- 一系列的统计,机器学习和深度学习方法可以有效地应用于NGS和微阵列数据.
- 本综述为研究人员提供了指导,以优化数据分析,改进预测建模,并获得更深入的生物学见解.
更多相关视频
13:24Integration of Wet and Dry Bench Processes Optimizes Targeted Next-generation Sequencing of Low-quality and Low-quantity Tumor Biopsies
Published on: April 11, 2016
11.8K
07:35Selecting Multiple Biomarker Subsets with Similarly Effective Binary Classification Performances
Published on: October 11, 2018
7.4K
