在非编码区域中对SNP进行机器学习研究,以预测非小细胞肺癌易感性
1Health Management Center, General Practice Medical Center, West China Hospital, Sichuan University, Chengdu, Sichuan 610041, China; Institute of Respiratory Healthy, West China Hospital, Sichuan University, Chengdu, Sichuan 610041, China.
这项研究在中国人群中发现了17个与非小细胞肺癌 (NSCLC) 风险相关的新遗传位置. 机器学习使用遗传和临床数据准确预测了NSCLC,有助于早期诊断.
科学领域:
- 遗传学 遗传学 是一个
- 在瘤学瘤学.
- 生物信息学是一种生物信息学.
背景情况:
- 非小细胞肺癌 (NSCLC) 是最常见的肺癌亚型.
- 环境和遗传因素都会影响肺癌的易感性.
- 了解遗传风险因素对于早期检测和预防至关重要.
研究的目的:
- 进行全基因组关联研究 (GWAS),以确定与中国人口中NSCLC风险相关的新型遗传变异.
- 利用机器学习的遗传和临床数据开发NSCLC易感性的预测模型.
- 探索机器学习在NSCLC的精密医学中的应用.
主要方法:
- 用Illumina全基因组亚洲查阵列芯片 (712,095个SNP) 对287名NSCLC患者和467名健康对照进行全基因组关联研究 (GWAS).
- 后勤回归建模用于识别与NSCLC风险相关的显著单核酸多态 (SNP) 位点.
- 机器学习算法应用于已识别的SNP,先前报告的SNP和临床共变量 (吸烟状态,年龄,CT查,性别) 的综合数据集.
主要成果:
- GWAS确定了17个与NSCLC风险相关的新型非编码区域SNP位点,其中顶级SNP (rs80040741,rs9568547,rs6010259) 实现了严格的p值 (<3.02e-6).
- 两个顶级SNP,rs80040741和rs6010259,分别是MUC3A和MLC1基因内的内基变异.
- 一个整合遗传和临床数据的机器学习模型在区分NSCLC患者和健康对照时实现了86%的准确性.
结论:
- 这项研究确定了在中国人群中对NSCLC风险作出贡献的新型遗传基因位点.
- 基因和临床数据与机器学习的整合为NSCLC早期诊断提供了一个有希望的方法.
- 这些发现增强了对机器学习应用在癌症易感性精密医学中的理解.
更多相关视频
09:34Targeted Next-generation Sequencing and Bioinformatics Pipeline to Evaluate Genetic Determinants of Constitutional Disease
Published on: April 4, 2018
07:59Author Spotlight: Advancements in Molecular Biomarker Testing for Non-Squamous Non-Small Cell Lung Cancer
Published on: September 8, 2023
相关概念视频
Single Nucleotide Polymorphisms-SNPs
Genome-wide Association Studies-GWAS
GWAS does not require the identification of the target gene involved in...
lncRNA - Long Non-coding RNAs
Comparing Copy Number Variations and SNPs
Copy number variations or CNVs are the structural variations that cover more than 1kb of DNA sequence. The single nucleotide polymorphism (SNP), on the other hand, is a single nucleotide change or a point mutation that is found in more than 1%...
