可扩展的基于CNN的选择性扫描分类,使用衍生代基频率
Sjoerd van den Belt1, Hanqing Zhao1, Nikolaos Alachiotis1
1Department of Computer Science, Faculty of EEMCS, University of Twente, 7522NB Enschede, The Netherlands.
Bioinformatics (Oxford, England)
|September 4, 2024
概括
一种新的深度学习模型FAST-NN,在没有预处理的情况下,有效地检测基因组数据中的选择性扫描. 这种机器学习方法为分析大型数据集提供了可扩展和快速的解决方案,性能优于现有方法.
科学领域:
- 遗传学 是一个遗传学.
- 计算生物学 计算生物学
- 机器学习 机器学习
背景情况:
- 选择性扫描对于理解适应至关重要,但由于人口瓶等混因素,难以检测.
- 使用单核酸多态 (SNP) 的现有方法对这些因素敏感,并且计算密集.
- 机器学习,特别是卷积神经网络 (CNN),提供了强大的检测潜力,但面临着大型基因组数据集的可扩展性问题.
研究的目的:
- 开发一个计算效率高,可扩展的深度学习模型,用于准确的选择性扫描检测.
- 在不需要数据预处理的情况下,创建一个强大的模型来混进化因素.
- 为了使CNN在大规模基因组数据分析中的实际应用.
主要方法:
- 提出了一个基于1D CNN的模型,名为FAST-NN.
- 利用衍生的等位基频率,避免总结统计数据或SNP原始数据.
- 基于SweepNet架构进行了神经架构搜索,并评估了数据融合方法.
主要成果:
- 在具有挑战性的场景中,FAST-NN实现了比参考架构高出12%的推断精度.
- 该模型证明了样本大小的不变性和可扩展性.
- FAST-NN比现有方法快得多:CPU上的30x-259x和GPU上的2.0x-6.2x为128-1000个样本.
结论:
- FAST-NN为选择性扫描检测提供了高精度,计算效率和可扩展的解决方案.
- 该模型对混因素的强度和缺乏预处理要求使其成为大规模基因组研究的实用性.
- 这项工作有助于在人口遗传学研究中广泛采用深度学习.


