通过机器学习模型进行可扩展和可解释的疾病预测的高维生物标志物识别
Yifan Dai1, Fei Zou1,2, Baiming Zou1,3
1Department of Biostatistics, University of North Carolina at Chapel Hill, Chapel Hill, NC, USA.
bioRxiv : the preprint server for biology
|October 17, 2024
概括
这项研究引入了高维特征重要性测试 (HiFIT),以从复杂的数据和疾病研究的临床数据中识别关键生物标志物和临床风险因素. HiFIT提高了疾病预测和生物标志物发现,帮助精准医学.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 基因组学就是基因组学.
背景情况:
- 复杂的人类疾病受OMIC数据和临床特征的影响.
- 识别关键的生物标志物和风险因素对于了解疾病机制和推进精准医学至关重要.
- 在欧米数据中,高维度和复杂的关联带来了分析挑战.
研究的目的:
- 开发一个强大的生物标志物和临床风险因素识别框架,从高维的数据和临床数据.
- 为了提高疾病结果的预测和复杂疾病的特征重要性识别.
- 为精准医学研究人员提供一个计算高效的工具.
主要方法:
- 提出了一个集成数据驱动的生物标志物识别工具,混合特征选 (HFS),以构建候选特征集.
- 开发了高维特征重要性测试 (HiFIT) 框架,通过基于排列的重要性测试来改进候选特征.
- 利用广泛的数值模拟和现实世界的应用程序来验证框架.
主要成果:
- 与现有方法相比,HiFIT在预测结果方面表现优越.
- 该框架有效地确定了关键生物标志物和临床风险因素.
- 在处理高维数据方面证明了计算效率.
结论:
- HiFIT框架为生物标志物发现和复杂疾病风险因素识别提供了一种强大的方法.
- HiFIT促进了早期疾病诊断和个性化治疗策略的进步.
- 为了支持研究界,HiFIT的R包已公开提供.


