持续适应预先训练的语言模型对单细胞RNA-seq数据的通用注释
Hui Wan1, Musu Yuan2, Yiwei Fu1
1School of Mathematical Sciences, Peking University, Beijing, China, 100871.
Briefings in bioinformatics
|February 22, 2024
概括
CANAL是一种用于单细胞RNA测序数据的细胞类型注释的新工具. 它使用持续学习和预训练的语言模型来适应新数据,防止知识丢失和识别罕见的细胞类型.
科学领域:
- 计算生物学是一种计算生物学.
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
背景情况:
- 单细胞RNA测序 (scRNA-seq) 数据的细胞类型注释对于生物医学研究至关重要.
- 现有的工具与不断出现的scRNA-seq数据作斗争,需要适应性模型.
- 基于变压器的预训练语言模型为单细胞生物学提供了强大的数据集成和可解释性.
研究的目的:
- 开发一种通用的细胞类型注释工具,从新的scRNA-seq数据中不断学习.
- 为了应对灾难性遗忘在 scRNA-seq 标注的持续学习模型中的挑战.
- 为了使细胞类型库的扩展和新型细胞类型的识别.
主要方法:
- 提出了CANAL,这是一种微调预训练语言模型的工具,用于新出现的标记scRNA-seq数据.
- 实现了经验重复模式,使用动态,类平衡的示例库来保留输入知识.
- 使用表示知识蒸来保存从以前模型状态的输出知识.
- 设计了一个框架,在微调和测试过程中纳入新的细胞类型.
主要成果:
- CANAL有效地减轻了模型输入和输出中的灾难性遗忘.
- 动态示例银行有助于整合模式,特别是对于罕见的细胞类型.
- 代表性知识蒸确保了知识在培训阶段的保存.
- 在使用多种数据流的实验中,CANAL表现出了多功能性和高可解释性.
结论:
- CANAL为scRNA-seq数据的连续细胞类型注释提供了一个强大的解决方案.
- 该工具可以动态扩展其细胞类型注释库,并识别新型细胞.
- CANAL在适应机器学习模型以适应单细胞基因组学的不断变化的格局方面取得了重大进展.
更多相关视频
07:12Author Spotlight: Enhancing Drug Discovery - Development of Automated, Standardized Protocols for Nuclei Extraction from Frozen Tissues
Published on: July 28, 2023
4.1K
05:45Author Spotlight: Integrating Organoid Models with Single-Cell and Spatial Transcriptomics Technologies
Published on: March 29, 2024
2.3K
