一种用于预测神经毒性和神经毒素的大型语言模型
Anand Singh Rathore1, Saloni Jain1, Shubham Choudhury1
1Department of Computational Biology, Indraprastha Institute of Information Technology, New Delhi, India.
Protein science : a publication of the Protein Society
|July 17, 2025
概括
我们开发了专门的AI模型NTxPred2,以准确预测和蛋白质中的神经毒性. 这提高了治疗蛋白质和转基因生物的安全性评估,减少了对动物的测试需求.
科学领域:
- 生物化学 生物化学
- 计算生物学 计算生物学
- 毒理学 毒理学 毒理学
背景情况:
- 对和蛋白质的神经毒性的准确预测对于治疗性蛋白质和转基因生物的安全性评估至关重要.
- 现有的预测工具经常使用单一的和蛋白质模型,忽视它们独特的结构和功能特征,可能会限制性能.
研究的目的:
- 开发神经毒性和神经毒素 (蛋白质) 的专业预测模型,以提高预测准确性和概括性.
- 通过创建针对和蛋白质独特性质的独特模型来解决现有的单一模型方法的局限性.
主要方法:
- 编制了神经毒性和非毒性和蛋白质的精心策划的数据集.
- 机器学习模型使用组合,二进制配置文件,进化信息,蛋白质嵌入和蛋白质语言模型进行训练.
- 模型使用五倍交叉验证进行了验证,并对独立数据集进行了测试,包括和蛋白质模型之间的交叉评估.
主要成果:
- 专门的模型实现了高预测性能:的AUC为0.97,蛋白质的AUC为0.85-0.94,使用各种方法.
- 蛋白质语言模型表现出强的性能,esm2-t30在上达到0.98的AUC,而esm2-t6在蛋白质上达到0.91.
- 专用模型在独立数据集上表现优于现有方法,证实了对和蛋白质有必要建立不同的模型.
结论:
- NTxPred2为和蛋白质提供专门的,准确的神经毒性预测模型.
- 这些模型增强了治疗性蛋白质和转基因生物的安全性评估,可能减少对动物试验的需求.
- 科学界可以使用一个独立的软件和Web服务器NTxPred2,用于预测和扫描神经毒素.


