Sa-TTCA:一种基于SVM的方法,用于瘤T细胞抗原分类,使用从生物测序和自然语言处理中提取的特征
Thi-Oanh Tran1, Nguyen Quoc Khanh Le2
1International Ph.D. Program in Cell Therapy and Regenerative Medicine, College of Medicine, Taipei Medical University, Taipei, 110, Taiwan; AIBioMed Research Group, Taipei Medical University, Taipei, 110, Taiwan; Hematology and Blood Transfusion Center, Bach Mai Hospital, No. 78, Giai Phong Street, Hanoi, Viet Nam.
Computers in biology and medicine
|April 18, 2024
概括
预测瘤T细胞抗原 (TTCA) 序列对于癌症疫苗至关重要. 将自然语言处理 (NLP) 与生物描述器相结合,提高了TTCA预测的准确性,有助于免疫治疗的发展.
科学领域:
- 免疫学和生物信息学
- 计算机生物学和瘤学
背景情况:
- 准确预测瘤T细胞抗原 (TTCA) 序列对于开发有效的癌症疫苗和免疫疗法至关重要.
- 大型组织相容性复合体 (MHC) 类I通过T细胞受体 (TCRs) 向CD8+T细胞呈现TTCA,但序列变异性对疫苗设计构成挑战.
- 机器学习 (ML) 模型为快速准确的TTCA识别提供了一个有希望的方法,其中代码是关键步骤.
研究的目的:
- 调查自然语言处理 (NLP) 方法对TTCA序列编码的有效性.
- 通过将生物描述符与基于NLP的特征集成,开发一个改进的TTCA预测模型.
- 为了提高癌症疫苗开发的蛋白质/功能预测的精度.
主要方法:
- 使用TTCA特征提取的生物描述符构建了一个基线ML模型.
- 使用NLP方法从生物语言模型 (BLM) 中提取的特征被纳入以提高模型性能.
- 使用千平方和皮尔森相关系数技术进行了特征选择,随后使用SMOTE,Up-sampling和Near-Miss进行了数据平衡.
- 在四个最有效的特征组上,Sa-TTCA模型使用支持向量机 (SVM) 算法进行了优化.
主要成果:
- 优化的Sa-TTCA模型在训练组中实现了87.5%的平衡精度,在独立测试组中达到72.0%.
- 生物描述符与NLP衍生特征的整合表明,有可能提高TTCA预测准确性.
- 这项研究强调了NLP在捕获生物序列的独特特征以进行预测建模方面的有效性.
结论:
- 将生物描述符与NLP技术相结合,可以显著提高预测蛋白质/功能性的准确性.
- 开发的Sa-TTCA模型,结合NLP,为推进癌症疫苗和免疫治疗研究提供了一个有前途的工具.
- 这种方法可以更精确地识别TTCAs,促进新型癌症治疗的设计.


