一种以数据为中心的机器学习方法,使用低失衡的TCGA数据来改善结质瘤等级的预测
Raquel Sánchez-Marqués1,2, Vicente García3, J Salvador Sánchez4
1Fundación Estatal, Salud, Infancia y Bienestar Social, 28029, Madrid, Spain.
Scientific reports
|July 26, 2024
概括
这项研究的重点是通过提高数据质量而不是仅仅通过算法来改善质瘤等级预测. 数据的标准化和平衡改善了机器学习模型的性能,特别是在组合方法中.
科学领域:
- 计算生物学和生物信息学
- 瘤学和癌症研究研究.
- 医学机器学习 医学机器学习
背景情况:
- 准确的质瘤分类对于患者的预后和治疗计划至关重要.
- 分子生物标志物和机器学习显示出改善诊断准确性的前景.
- 现有的研究往往优先考虑以模型为中心的方法,而不是数据质量.
研究的目的:
- 调查以数据为中心的机器学习方法来预测质瘤等级.
- 评估数据标准化和类平衡对模型性能的影响.
- 为了比较标准机器学习模型和分类器组合的有效性.
主要方法:
- 采用以数据为中心的方法,专注于数据质量改进.
- 利用六个性能指标来全面评估模型预测.
- 在临床和分子生物标记数据集上使用四种特征排名算法进行属性分析.
主要成果:
- 数据标准化和少数群体类型的超大化显著改善了四个机器学习模型和两个分类器组合的预测性能.
- 与三种标准预测模型相比,分类器组合显示出更高的性能.
- 在质瘤数据集中确定了关键的统计特征和信息属性.
结论:
- 以数据为中心的方法,强调数据质量,可以提高机器学习模型在质瘤等级预测中的性能.
- 数据标准化和平衡是提高预测准确性的有效策略.
- 分类器组合显示出使用集成的临床和分子数据准确分类质瘤的巨大潜力.
更多相关视频
07:15Machine Learning Algorithms for Early Detection of Bone Metastases in an Experimental Rat Model
Published on: August 16, 2020
6.8K
09:53Quantifying the Brain Metastatic Tumor Micro-Environment using an Organ-On-A Chip 3D Model, Machine Learning, and Confocal Tomography
Published on: August 16, 2020
7.2K
