ParaDeep:基于序列的深度学习,用于使用连锁意识的BiLSTM-CNN模型预测残留水平的paratope.
Piyachat Udomwong1, Thanathat Pamonsupornwichit2, Kanchanok Kodchakorn3,4
1International College of Digital Innovation, Chiang Mai University, Chiang Mai, Thailand.
Frontiers in bioinformatics
|November 21, 2025
概括
使用深度学习,ParaDeep从氨基酸序列中准确地预测抗体paratopes. 这种轻量级的框架提供了高性能,特别适用于重链,加速了在没有结构数据的情况下发现抗体.
科学领域:
- 计算生物学是一种计算生物学.
- 免疫信息学是指免疫信息学.
- 机器学习在药物发现中的作用
背景情况:
- 准确的抗体帕拉托普预测对于抗体发现工作流程至关重要.
- 现有的方法通常依赖于结构数据,限制了高通量应用.
研究的目的:
- 开发ParaDeep,这是一个深度学习框架,用于直接从抗体氨基酸序列预测残留水平的帕拉托普.
- 评估ParaDeep在各种模型配置和抗体链类型中的性能.
主要方法:
- 帕拉迪普集成双向长短期内存 (LSTM) 网络与1D卷积层.
- 对30种模型配置,不同编码方案,内核大小和抗体链类型 (重型和轻型) 的系统评估.
- 使用五倍交叉验证和独立的盲测试集评估性能,采用F1分数和马修斯相关系数 (MCC).
主要成果:
- 与轻链模型 (F1 = 0.774,MCC = 0.772) 相比,重链模型在交叉验证中取得了更高的性能 (F1 = 0.856,MCC = 0.842).
- 在盲测试组中,ParaDeep在重链中实现了F1 = 0.723和MCC = 0.685,在MCC中表现比Parapred的基线优于27%.
- 重链提供更强的基于序列的预测信号,而轻链更受益于结构上下文.
结论:
- ParaDeep提供了一种轻量级,可解释和基于序列的方法来预测帕拉托普,与重链的基于结构的方法竞争.
- 它的效率和可扩展性非常适合早期抗体发现,谱系分析和治疗设计,特别是当结构数据不可用时.
- 该框架通过开源代码和Google Colab可访问,这有助于在抗体研究中更广泛地采用.
