纳米孔调用者的有效培训,以获得有限的标签数据的表观遗传标记
Brian Yao1, Chloe Hsu1, Gal Goldner2
1Department of Electrical Engineering & Computer Sciences, University of California , Berkeley, CA 94720, USA.
Open biology
|June 11, 2024
概括
对于纳米孔测序的机器学习模型可以检测DNA基基修改. 一种新的混合方法 (消耗-HMM) 在训练数据不完整时提高了准确性,超过了现有的表观遗传分析方法.
科学领域:
- 基因组学和表观遗传学
- 生物信息学和计算生物学
背景情况:
- 纳米孔测序与机器学习 (ML) 相结合,在识别像5-甲基素 (5mC) 和N6-甲基氨酸 (6mA) 等DNA基基修饰方面表现出色.
- 当前的ML调用者往往需要完整的训练数据集,涵盖所有修改和序列上下文,这些对新型表观遗传修改变得不可行.
- 传统的隐藏马尔科夫模型 (HMM) 由于独立的发射分布而难以处理未见的序列上下文,而深度神经网络 (DNN) 则显示出更好的概括性.
研究的目的:
- 在不完整的训练数据场景下评估现有的纳米孔调用方法的性能.
- 开发和验证一种新的计算方法来检测基调改性,这种方法对有限的训练数据具有稳定性.
- 证明拟议方法对复杂表观遗传分析的有用性,包括新的修改和同时调用.
主要方法:
- 使用不完整的训练数据集对深度神经网络 (DNN) 方法 (DeepSignal) 与隐藏马尔科夫模型 (HMM) 方法 (Nanopolish) 的比较分析.
- 开发一种新的混合HMM-DNN模型,称为"折旧HMM",旨在利用参数共享来改进泛化.
- 这些方法在纳米孔测序数据中检测5-甲基素 (5mC) 的应用和评估.
主要成果:
- 在不完整的数据上训练时,DNN方法 (DeepSignal) 与HMM方法 (Nanopolish) 相比表现优越.
- 拟议的折旧HMM方法在5mC的调用精度下在不完整的训练条件下明显优于纯HMM和纯DNN方法.
- 结果表明,混合模型可以有效地应对纳米孔基表观遗传分析中有限的训练数据的挑战.
结论:
- 深度学习模型为纳米孔基调整调用提供了比HMM更好的概括性,特别是在不完整的数据中.
- 新型的折旧-HMM方法提供了显著的进步,即使在没有全面的培训数据集的情况下,也可以进行准确的表观遗传分析.
- 这种混合策略对未来涉及新基基改造 (如5-基甲基) 和同时检测多种改造的应用具有前景.


