玛:在不完整的标签下挖掘缺口感知动机,并对MHC动机进行应用
Xinyi Tang1,2, Ran Liu3
1Department of Mathematics, Statistics and Insurance, The Hang Seng University of Hong Kong, Hang Shin Link, Siu Lek Yuen, Shatin, N.T., Hong Kong SAR, China.
Bioinformatics (Oxford, England)
|January 15, 2026
概括
我们开发了GAMMA,这是一种用于识别MHC类I结合至关重要的非连续序列基因的新算法. GAMMA准确地识别了结合残留物,并揭示了结合的潜在灵活性.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 免疫信息学是指免疫信息学.
背景情况:
- 序列动机识别对于理解分子识别和免疫反应至关重要.
- 目前用于MHC I类结合基因的方法假设连续的九个氨基酸跨度,可能会忽视非相邻的残留相互作用.
- 结构数据表明,MHC-结合可能涉及非连续的残留物,需要先进的动机发现方法.
研究的目的:
- 开发一种新的计算框架,用于识别非连续序列动图.
- 为了解决MHC I类结的现有模式发现工具的局限性.
- 在图案识别中考虑不完整的标签和可变的残留间距.
主要方法:
- 提出了一个概率框架,即 Gap-Aware 动机采矿算法 (GAMMA).
- 使用马尔科夫链蒙特卡洛 (MCMC) 采样的贝叶斯推理.
- 共同估计的图案参数,结合位置和残留间距.
主要成果:
- GAMMA准确地识别非连续的图案和结合残留物,优于现有的工具,如GLAM2.
- 分析表明,MHC I类的最佳结合残留数可能是八个,而不是九个.
- 该模型捕捉了中央的灵活性,与凸的结构观测保持一致.
结论:
- GAMMA提供了一种可靠的方法,用于在生物数据中发现非连续的序列动图.
- 这些发现挑战了关于MHC I类类结合基因的传统假设.
- 该算法在定位结合残留物和理解-MHC相互作用方面提供了更高的准确性.


