SyntheVAEiser:通过基于VAE的基因表达样本生成来增强传统的机器学习方法,以改善癌症亚型预测
Brian Karlberg1, Raphael Kirchgaessner1, Jordan Lee1
1Biomedical Engineering, Oregon Health and Science University, 3181 S.W. Sam Jackson Park Road, Portland, OR, 97239-3098, USA.
Genome biology
|December 19, 2024
概括
使用SyntheVAEiser合成基因表达数据可以提高癌症亚型预测的机器学习准确性,特别是在代表性不足的群体中. 这种数据增强提高了人工智能模型在生物信息学中的性能.
科学领域:
- 生物信息学是一种生物信息学.
- 机器学习 机器学习
- 计算生物学 计算生物学
背景情况:
- 机器学习的准确性往往受限于有限的训练数据可用性.
- 有效的数据增强策略对于提高复杂生物数据集中的模型性能至关重要.
研究的目的:
- 引入一种用于合成基因表达样本的新方法,以增加现有数据集.
- 通过机器学习评估合成数据生成的能力,以提高癌症亚型预测的准确性.
主要方法:
- 开发SyntheVAEiser,一种基于自编码器的变异性工具,用于基因表达数据的合成.
- 培训和测试SyntheVAEiser工具的数据集,包括超过8000个癌症样本.
- 评估增强数据集对癌症亚型分类预测任务的执行的影响.
主要成果:
- 证明合成基因表达样本生成可以有效地增强机器学习训练数据集.
- 癌症亚型识别的表现显著提高,特别是在代表性不足的队列中.
- 验证了SyntheVAEiser在改善真实世界生物医学环境中的机器学习模型准确性的实用性.
结论:
- 使用合成生成的基因表达样本进行数据增强是克服机器学习数据局限性的可行策略.
- SyntheVAEiser提供了一种强大的工具,可以提高癌症亚型分类模型的预测准确度.
- 提出的方法有望改善罕见或代表性不足的癌症亚型的识别和分析.


