基于CNN-BLSTM的深度学习框架用于真核细胞基因组分类:一种基于解释性的方法
Chinju John1, Jayakrushna Sahoo1, Irish K Sajan1
1Department of Computer Science and Engineering, Indian Institute of Information Technology Kottayam, Kottayam, 686635, Kerala, India.
Computational biology and chemistry
|August 13, 2024
概括
这项研究为蛋白质组学中使用的深度学习模型引入了一个新的可解释性管道. 该管道提高了对真核细胞基因组序列的分类可靠性,提高了对生物研究人工智能的信任.
科学领域:
- 蛋白质组学是指蛋白质组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 从序列来分类蛋白质家族在蛋白质组学中至关重要.
- 目前的深度学习模型由于其黑子性质而缺乏可靠性.
- 需要可解释的AI来增强对生物序列分析的信任.
研究的目的:
- 开发和验证一种新型的可解释性管道,用于真核细胞基因组分类中的深度学习模型.
- 提高人工智能驱动的生物序列分析的可靠性和可信度.
- 确定影响酶分类决策的关键特征.
主要方法:
- 对最先进的深度学习算法的比较分析.
- 选择和应用CNN-BLSTM模型来分类八个真核细胞激酶家族.
- 集成GRAD CAM和集成梯度 (IG) 进行模型解释.
- 通过掩盖已识别的酶域痕迹进行实验验证.
主要成果:
- 该CNN-BLSTM模型在分类激酶序列方面取得了很高的准确性.
- 可解释性管道成功识别了关键激酶域痕迹.
- 掩盖这些已识别的域导致F1得分显著下降 (0.96至0.76).
- 结果与可解释的人工智能原则一致,证明了模型的可信度.
结论:
- 拟议的可解释性管道提高了生物序列分类的深度学习模型的可靠性.
- 这种方法为酶分类提供了可解释的见解,超越了黑子预测.
- 这些发现支持可解释AI在蛋白质组学和相关领域的更广泛应用.


