使用保存的基因预测大肠杆菌中的可变基因含量
Marcus Nguyen1,2, Zachary Elmore3, Clay Ihle3
1Data Science and Learning Division, Argonne National Laboratory , Lemont, Illinois, USA.
机器学习准确地预测了Escherichia coli基因组中的可变基因含量,使用保存的基因k-mers. 该框架有助于对生物信息学任务进行基因组分析和风险评估.
科学领域:
- 基因组学和生物信息学
- 计算生物学 计算生物学
- 机器学习在生物学中的应用
背景情况:
- 预测编码蛋白质的基因含量对于分析不完整或组装的基因组至关重要.
- 准确的基因含量预测支持各种生物信息学任务,包括基因组质量评估和风险评估.
研究的目的:
- 开发和验证机器学习分类器,用于预测大肠杆菌基因组中的可变基因含量.
- 证明使用保存基因中的核酸k-mers作为基因含量预测特征的实用性.
主要方法:
- 构建了3,259个极端梯度增强分类器,以预测大肠杆菌基因组中蛋白质家族的存在/缺席.
- 从100个保存的基因中利用核酸k-mers作为输入特征.
- 定义了使用蛋白质家族和专注于基因在10%-90%的基因组中存在的基因.
主要成果:
- 在所有分类器中获得0.944的高平均宏观F1得分.
- 证明了对标注差的蛋白质 (F1 = 0.902) 和与水平基因转移相关的基因 (F1s从0.824到0.895不等) 的准确预测.
- 在来自环境来源的E. coli基因组 (平均F1分数为0.880) 的多样化的持久集上验证了模型性能.
结论:
- 已经建立了一个强大的框架,用于使用有限序列数据预测可变基因含量.
- 开发的模型是准确的,稳定在不同的大肠杆菌菌株,并可扩展到不同的基因组数据集.
- 这种方法为增强微生物基因组学中的基因组分析和风险评估提供了有价值的策略.
更多相关视频
11:12Determination of the Optimal Chromosomal Locations for a DNA Element in Escherichia coli Using a Novel Transposon-mediated Approach
Published on: September 11, 2017
09:44Characterization of a Pathogenic Escherichia coli Strain Derived from Oreochromis spp. Farms Using Whole-Genome Sequencing
Published on: December 23, 2022
相关概念视频
Multi-species Conserved Sequences
Although the genome of each species varies greatly from each other, a few sequences are highly conserved. Such conserved...
Gene Evolution - Fast or Slow?
In contrast, regions which code...
Constitutive and Regulated Gene Expression
Genome Size and the Evolution of New Genes
Coordination of Gene Expression Processes in Bacteria
Reporter Genes
