可解释的机器学习方法通过RNA测序数据的二元化来预测癌症
Tianjie Chen1, Md Faisal Kabir1
1Department of Computer Science, Pennsylvania State University Harrisburg, Middletown, Pennsylvania, United States of America.
PloS one
|May 10, 2024
概括
这项研究引入了数据二元化,以从RNA测序数据中改进机器学习的癌症诊断. 该技术提高了模型的可解释性,并保持了性能,有助于更清晰的预测.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组学就是基因组学.
背景情况:
- 机器学习模型显示了使用RNA测序数据快速诊断癌症的前景.
- 从复杂的,高维的RNA测序数据解释预测仍然是一个重大挑战.
研究的目的:
- 为RNA测序数据提出和评估一种新的数据二元化技术.
- 使用这种技术开发可解释的癌症预测模型.
- 评估二元化对模型性能和特征重要性的影响.
主要方法:
- 应用了对RNA测序数据的二元化技术.
- 构建了五个机器学习模型:神经网络,随机森林,xgboost,支持向量机器和决策树.
- 利用了来自国家癌症研究所基因组数据共享的四个癌症数据集.
- 使用不平衡数据集的指标评估模型性能 (几何平均值,MCC,F-Measure,AUC).
主要成果:
- 二元化方法产生了跨模型的比较性能.
- 这种方法需要更少的预测特征.
- 数据二元化通过澄清特征贡献,显著提高了模型可解释性.
- 该技术显示了提高性能和可解释性的潜力.
结论:
- 数据二元化是处理RNA测序数据在癌症预测中的可行技术.
- 这种方法提高了机器学习模型在瘤学中的可解释性.
- 这种方法为开发更透明,更有效的诊断工具提供了一个有希望的途径.


