PLMACP基于蛋白质语言模型和波纹消灭转换的抗癌的预测
Muhammad Arif1, Saleh Musleh1, Huma Fida2
1College of Science and Engineering, Hamad Bin Khalifa University, Doha, Qatar.
Scientific reports
|July 23, 2024
概括
一个新的机器学习模型,PLMACPred,从序列中准确识别抗癌 (ACP),加速药物发现. 这种计算方法克服了寻找新型ACP的传统湿实验室方法的局限性.
科学领域:
- 生物化学 生物化学
- 计算生物学 计算生物学
- 药物发现 药物发现 药物发现
背景情况:
- 抗癌 (ACP) 显示出治疗潜力,副作用最小.
- 传统的ACP湿实验室识别是耗时的,劳动密集的和昂贵的.
- 计算方法为ACP预测提供了更快,更准确的方法.
研究的目的:
- 开发一种基于机器学习的预测器,PLMACPred,仅从序列来识别ACP.
- 利用先进的编码方案和深度学习来提高非洲和非洲的预测准确性.
- 提供一个可解释的模型,以了解在ACP识别中特征的重要性.
主要方法:
- 序列是使用进化性质,组成性质和蛋白质语言模型 (PLM) 编码的,包括进化规模建模 (ESM-2) 和ProtT5嵌入.
- 应用了二维 (2D) 波形无声化 (WD) 对预处理提取的特征.
- 基于集体级联深森林 (CDF) 模型被用于ACP分类.
主要成果:
- 通过十倍交叉验证和独立测试,PLMACPred在三个基准数据集 (ACPmain,ACPAlter,ACP740) 中表现出卓越的性能.
- 该模型在预测准确度方面取得了显著的改进:与现有方法相比,ACPmain的预测准确率为18.53%,ACPalter的预测准确率为2.4%,ACP740的预测准确率为7.59%.
- ProtT5和ESM-2嵌入式被证明有效地捕获了用于ACP预测的上下文序列信息.
- SHAP分析提供了模型可解释性,MEME套件确定了新的ACP序列模式.
结论:
- PLMACPred提供了一个高度准确和高效的计算工具,用于识别抗癌.
- 该模型的性能突显了基于PLM的嵌入和集体深度学习在ACP发现中的有效性.
- 预计PLMACPred将加速新型ACP的识别,并促进微生物应用领域的进一步研究.


