一个集成的多模型框架,利用卷积神经网络与特征提取相结合,用于识别DNA序列中的4mC位点
Muhammad Tahir1, Shahid Hussain2, Fawaz Khaled Alarfaj3
1Department of Electrical and Computer Engineering, University of Manitoba, Winnipeg, Manitoba, R3T5V6, Canada; Department of Computer Science, Abdul Wali Khan University, Mardan, 23200, Pakistan.
Computers in biology and medicine
|October 26, 2024
概括
这项研究引入了一种新的多模型框架,使用CNN与k-mer和嵌入技术来准确识别DNA中的N4-甲基 (4mC) 位点. 该方法显著改进了现有的表观遗传调节分析方法.
科学领域:
- 表观遗传学和分子生物学
- 生物信息学和计算生物学
- 基因组学和DNA修改 基因组学和DNA修改
背景情况:
- N4-甲基细胞氨酸 (4mC) 是一个关键的DNA表观遗传修饰调节基因表达,DNA修复和复制.
- 了解4mC的作用对于破译基因表达复杂性和细胞运作至关重要.
- 由于资源和时间的限制,对4mC遗址的实验性识别面临挑战.
研究的目的:
- 开发一种先进的计算框架,用于准确识别DNA序列中的4mC位点.
- 使用数据驱动方法克服实验方法的局限性.
- 通过改进4mC位点检测,增强表观遗传调节的分析.
主要方法:
- 卷积神经网络 (CNN) 与分布式k-mer和嵌入特征提取的集成.
- K-mers捕捉了局部序列模式,而嵌入则提供了整体的序列背景.
- 美国有线电视新闻网使用卷积过器来检测分布式序列表示中的重要局部模式.
主要成果:
- 拟议的多模型框架在识别4mC地点方面表现出卓越的表现.
- 超越了包括4mCPred,4mCCNN等在内的最先进的方法.
- 与一热编码和混合功能相比,实现了更高的准确性,特异性和灵敏性.
结论:
- 集成的CNN框架与k-mer和嵌入功能为4mC网站识别提供了一个强大的工具.
- 这种方法减轻了实验挑战,为更有效的表观遗传学研究铺平了道路.
- 这些发现有助于更深入地了解DNA修饰和基因调节.


