使用生物医学命名实体识别和随机森林分类来识别和优先考虑疾病候选基因
Sushrutha Raj1, Vindhya Namdeo2, Payal Singh2
1Amity Institute of Integrative Sciences and Health, Amity University Haryana, Amity Education Valley, Gurgaon, 122413, India.
Computers in biology and medicine
|May 11, 2025
概括
这项研究引入了一种新的两层机器学习协议,用于从摘要中识别与疾病相关的基因. 该方法准确地分类基因关联,发现了阿尔茨海默氏症,乳腺癌和2型糖尿病等复杂疾病的新候选基因.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 识别候选基因对于理解复杂疾病至关重要,使早期诊断,个性化治疗和药物发现成为可能.
- 疾病基因鉴定的传统方法面临局限性,需要大样本大小和高统计能力,这对于复杂的疾病来说具有挑战性.
- 现有的疾病基因优先级方法通常依赖于缺乏实验验证的计算预测.
研究的目的:
- 引入创新的双层机器学习协议,从疾病特定摘要中提取疾病基因关联细节.
- 通过高级文本挖掘,将疾病基因关联分为积极,消极和模两可的类别.
- 解决现有工具在疾病基因识别和优先考虑方面的局限性.
主要方法:
- 使用一个双层机器学习协议,使用Random Forest进行文本分类.
- 一级分类器区分疾病基因关联的存在或不存在.
- 2级分类器进一步将关联分为积极,消极和模两可的类别,在阿尔茨海默病,乳腺癌和2型糖尿病数据集上进行训练和验证.
主要成果:
- 实现了高精度:97.29%的1级分类和98.14%的2级分类.
- 成功提取了分别为阿尔茨海默氏症,乳腺癌和2型糖尿病的2769,3220和740个正相关基因.
- 发现了大量新基因 (1008个用于阿尔茨海默氏症,670个用于乳腺癌,165个用于2型糖尿病),这些基因不在现有数据库中,扩大了基因探索.
结论:
- 开发的协议为探索遗传疾病提供了一个全面的路线图.
- 该协议在不同疾病背景 (阿尔茨海默氏症,乳腺癌,2型糖尿病) 中表现出了多功能性和稳健性.
- 这些发现为有针对性的干预提供了有希望的候选人,并突出了模糊的关联,以便进一步研究,在生物医学研究中具有广泛的适用性.


