基于代谢学的机器学习模型准确地预测乳腺癌雌激素受体状态
Kamala K Arumalla1, Jean-François Haince2, Rashid A Bux3
1Department of Analytics, Harrisburg University of Science and Technology, Harrisburg, PA 17101, USA.
International journal of molecular sciences
|December 17, 2024
概括
这项研究确定了用于非侵入性乳腺癌亚型的关键代谢物生物标志物. 机器学习可以准确地区分雌激素受体阳性和阴性瘤,提高诊断精度.
科学领域:
- 代谢学 代谢学 代谢学
- 生物标志物发现发现
- 机器学习在瘤学中
背景情况:
- 乳腺癌是全球女性死亡的主要原因之一.
- 精确确定雌激素受体 (ER) 状态对于预后和治疗至关重要.
- 目前的ER状态检测方法可能具有侵入性和挑战性.
研究的目的:
- 确定非侵入性血代谢物生物标志物,以区分ER阳性与ER阴性乳腺癌.
- 开发和验证基于代谢学数据的乳腺癌亚型的机器学习模型.
主要方法:
- 利用来自乳腺癌患者和健康对照者的血样本的代谢学数据.
- 使用递归特征消除 (RFE) 与随机森林 (RF) 进行特征选择.
- 应用数据增强技术 (高斯噪声,ADASYN) 来处理类失衡.
- 使用网格搜索评估了四个机器学习算法 (RF,SVC,XGBoost,LR).
主要成果:
- 使用RFE-RF.确定了30个特征 (29个生物标志物和年龄) 的最佳子集.
- 随机森林分类器以0.95和93%的曲线下面面积 (AUC) 准确度实现了最高的性能.
- 开发的模型在区分ER-阳性和ER-阴性乳腺癌方面表现出高效.
结论:
- 血代谢学的机器学习分析对非侵入性乳腺癌亚型的研究具有显著的前景.
- 这种方法可能会带来一种新的分析工具,以克服当前在ER状态确定方面的挑战.
- 提高乳腺癌亚型的精度可以提高患者的预后和治疗策略.


