训练数据构成对单细胞生物学深度学习模型的后果
Ajay Nadig1,2,3, Akshaya Thoutam4, Madeline Hughes4
1Harvard Medical School, Boston, MA, USA.
bioRxiv : the preprint server for biology
|March 10, 2025
概括
单细胞转录组学的基础模型需要多样化的训练数据来提高性能. 优化数据集可以提高对新细胞类型和疾病状态的概括性.
科学领域:
- 计算生物学是一种计算生物学.
- 基因组学就是基因组学.
- 机器学习是机器学习.
背景情况:
- 基础模型为单细胞转录组学分析提供了潜力,特别是在稀疏数据的情况下.
- 当前的单细胞基础模型在大体上进行训练,经常忽视训练数据组成对性能的影响.
- 大型语言模型研究强调了训练数据组成在塑造模型行为的关键作用.
研究的目的:
- 系统地研究训练数据集组成如何影响单细胞转录组学深度学习模型.
- 评估模型对未见的细胞类型和疾病状态的概括.
- 确定优化未来单细胞基础模型的策略.
主要方法:
- 专注于人类血液形成作为一个模型系统.
- 包括来自成年和发育组织的多种细胞类型,疾病状态和扰乱地图.
- 系统地改变训练数据集组成以评估模型行为.
主要成果:
- 模型表现出对未见的细胞类型的概括不佳.
- 将恶性细胞纳入训练数据并没有持续改善未见恶性细胞的建模.
- 包括胚胎干细胞分化数据在内,在分布之外的任务上提高了性能.
结论:
- 训练数据的多样性对于有效的单细胞基础模型至关重要.
- 当前的培训策略可能导致不良的概括.
- 未来的模型应该优先考虑精选的,多样化的数据集,以提高性能和更广泛的适用性.


