半监督数据集成特征的重要性提高了生物分类任务的性能和可解释性
Jun W Kim1, Russ B Altman1,2
1Department of Biomedical Data Science, Stanford University, Stanford, CA 94305, United States.
Bioinformatics (Oxford, England)
|July 15, 2025
概括
半监督数据集成特征重要性 (DIFI) 通过整合先前信息,使人工智能模型与人类知识保持一致. 这种新的方法提高了模型在生物任务中的性能和可解释性.
科学领域:
- 计算生物学 计算生物学
- 机器学习 机器学习
- 生物信息学是一种生物信息学.
背景情况:
- 标准模型的性能指标不能保证与人类知识的协调,限制了现实世界的适用性.
- 将先前的知识整合到机器学习模型中,对于提高相关性和可解释性至关重要.
研究的目的:
- 引入半监督数据集成特征重要性 (DIFI),这是一种将先验知识集成到模型特征权重中的新方法.
- 改进模型特征的重要性与人类知识之间的调整.
主要方法:
- 在数值上,DIFI将作为稀疏的知识地图表示的外部知识集成到模型的特征权重过程中.
- 损失函数结合了知识图和模型的特征图之间的相似性,以指导特征权重.
- 该方法在两个生物学任务上进行了测试:癌症类型预测和酶/非酶分类.
主要成果:
- 在基因表达数据的癌症类型预测和蛋白质序列的酶分类方面,DIFI改善了神经网络的性能.
- 该方法的结果是具有可解释性和与生物知识 (癌症生物标志物和催化残留物) 相一致的特征权重.
- DIFI展示了增强的模型对齐和可解释性.
结论:
- DIFI是将域名知识注入机器学习模型的有效方法,从而提高性能和可解释性.
- 该方法成功地将模型特征的重要性与人类在生物应用中的专业知识相协调.
- 代码和模型是公开可用的可复制性和进一步研究.
更多相关视频
04:57Assisted Selection of Biomarkers by Linear Discriminant Analysis Effect Size LEfSe in Microbiome Data
Published on: May 16, 2022
16.2K
08:51Author Spotlight: Integrated Multi-Omics Analysis for Unveiling Multicellular Immune Signatures in Clinical Heart Attack Cohorts
Published on: September 20, 2024
1.5K
