基于RNAseq表达的儿童恶性瘤诊断分类系统
bioRxiv : the preprint server for biology
|September 2, 2025
概括
一个新的机器学习模型CanID (癌症识别) 仅使用基因表达数据准确地分类儿童癌症亚型. 这种工具提高了瘤诊断和精确治疗的分层.
科学领域:
- 癌症学
- 生物信息学
- 机器学习
背景情况:
- 儿童癌症亚型的分类对于向治疗至关重要.
- 目前的方法在儿童癌症的范围,精度和标准化方面面临挑战.
- 基于Omics的机器学习分类器越来越多地用于增强组织病理学.
研究的目的:
- 为儿童癌症亚型开发一个强大的机器学习分类方案.
- 解决分类各种儿童固体瘤和血液恶性瘤的分析挑战.
- 为改善瘤诊断和分层提供基于转录组的方法.
主要方法:
- 开发了癌症识别 (CanID),一个堆叠的整体机器学习模型.
- 使用基因级RNA测序计数数据 (转录组特征) 作为唯一的输入.
- 在3203个儿童癌症样本中训练CanID,
主要成果:
- 在独立测试数据集中,对固体瘤达到99%的准确性,对血液恶性瘤达到92-93%的准确性.
- 对生物和技术变异,包括数据收集差异和阶级不平衡的证明.
- 成功分类了难以临床组织学评估的具有挑战性的亚型.
结论:
- CanID为儿童癌症提供了基于转录组的高度准确和强大的分类方案.
- 该模型的生物解释性有助于推进瘤诊断和分层.
- 在精密瘤学和临床决策方面,CanID是一个有价值的工具.


