CATH v4.4:通过实验和预测结构数据对CATH的重大扩展
Vaishali P Waman1, Nicola Bordin1, Andy Lau2,3
1Institute of Structural and Molecular Biology, University College London, London WC1E 6BT, UK.
Nucleic acids research
|November 20, 2024
概括
现在CATH数据库包括了来自蛋白质数据库的显著更多的蛋白质域结构和来自Domains百科全书的预测结构,扩大了其蛋白质超级家族和功能家族的分类.
科学领域:
- 结构生物信息学 结构生物信息学
- 蛋白质域分类蛋白质域分类
- 计算生物学是一种计算生物学.
背景情况:
- CATH数据库提供了蛋白质域结构的层次分类.
- 它整合了来自蛋白质数据库 (PDB) 和AlphaFold蛋白质结构数据库 (AFDB) 的数据.
- 之前的版本依赖于实验确定结构,限制了预测结构的覆盖范围.
研究的目的:
- 报告自2021年以来CATH分类的发展情况.
- 将大量预测的蛋白质域结构纳入其中.
- 扩大蛋白质域的功能和结构注释.
主要方法:
- 从PDB (CATH v4.4) 中分类实验确定域.
- 从域名百科全书 (TED) 资源将预测的域名映射到CATH超级家族.
- 通过扫描隐藏的马尔科夫模型 (HMMs) 与UniProt.com对比,更新了功能类型 (FunFams).
主要成果:
- 对CATH超级家族的结构信息的显著扩展 (增加了180倍).
- 纳入了64,844个经过实验确定的PDB域和9000万个预测的TED域.
- 将超级家族的数量增加到6573个,折叠到2078个,架构的数量增加到77.
- 实现了FunFams覆盖率的276%增加和FunFams结构信息的4倍增加.
结论:
- 来自TED的预测结构的集成大大扩展了CATH数据库.
- 这种扩展增强了蛋白质域的分类和注释,包括假设结构.
- 更新的FunFams改进了蛋白质域的功能表征.


