通过泛基MHC-I点突变连体组评估评估,评估训练可概括的基于序列的TCR特异性模型的数据大小要求
Antoine Delaunay1, Miles McGibbon2, Bachir Djermani3
1InstaDeep Ltd, 5 Merchant Sq, London, UK. a.delaunay@instadeep.com.
Scientific reports
|November 27, 2025
概括
开发个性化的T细胞受体 (TCR) 疗法需要预测TCR-neoepitope结合. 当前的机器学习模型需要数以百万计的数据点进行概括,远远超过有效的瘤治疗的可用数据.
科学领域:
- 免疫学 免疫学 免疫学
- 计算生物学 计算生物学
- 在瘤学瘤学.
背景情况:
- 针对癌症的个性化T细胞受体 (TCR) 疗法依赖于识别结合患者特异性新表位的TCR.
- 对于开发可概括的预测模型来说,TCR和neoepitope谱的巨大多样性构成了重大挑战.
研究的目的:
- 为了估计预测TCR-pMHC特异性的机器学习模型所需的训练数据大小.
- 评估现有模型对未见的TCR和表征的概括性.
主要方法:
- 验证了现有模型的有限概括性,以单个残留表位异同.
- 在34个人类MHC等位基因中输入点突变连接体,以图形形式表示.
- 确定图表中占主导地位的集合以估计数据需求.
主要成果:
- 已发表的TCR特异性模型未能在最小的表位序列变异之外进行概括.
- 据估计,对于基于序列的可概括的TCR特异性预测模型,需要1到1亿个独特的表位.
- 这一要求大约是目前公开可用的数据的1000倍.
结论:
- 目前的数据集不足以训练针对个性化癌症治疗的强大,可概括的TCR特异性预测模型.
- 培训数据的显著扩展是必要的,以推进基于TCR的瘤治疗领域.


