修改基于信息理论的虚假发现率程序在任意相关结构下及其在高维基因组数据中的表现
Sedighe Rastaghi1, Azadeh Saki2, Hamed Tabesh3
1Department of Epidemiology and Biostatistics, School of Health, Mashhad University of Medical Sciences, Mashhad, Iran.
新修改的程序通过计算测试统计数据之间的相关性来控制多重比较程序 (MCP) 中的错误发现率 (FDR). 这些方法提供了更好的灵活性和效率,特别是在高维数据分析中.
科学领域:
- 统计 统计 统计 统计
- 生物信息学是一种生物信息学.
- 基因组学就是基因组学.
背景情况:
- 控制错误发现率 (FDR) 在跨科学领域的多重比较程序 (MCP) 中至关重要.
- 测试统计相关性可以增加FDR变异和偏差,需要强大的控制方法.
- 信息理论提供了一种新的方法来修改MCPs的相关性结构.
研究的目的:
- 开发和评估使用信息理论解释任意相关性结构的修改后的MCP.
- 将拟议程序 (M1,M2,M3) 的性能与既有方法 (如Benjamini-Hochberg (BH) 和Benjamini-Yekutieli (BY) 等) 的性能进行比较.
- 评估这些程序在分析高维基因表达数据中的实用性.
主要方法:
- 提出了基于条件费舍尔信息的三个修改程序 (M1,M2,M3).
- 采用模拟研究与多变量高斯特征在不同的相关性水平.
- 应用程序到真正的高维结直肠癌基因表达数据.
- 用有效的贝叶斯逻辑回归 (EBLR) 进行预测建模.
主要成果:
- 建议的程序在没有相关性的情况下与BH类似地执行.
- 在低到中等相关性方面,BY是保守的,BH是自由的;提出的方法显示,特征选减少,相关性增加.
- 在高度相关的场景中,提出的方法接近了邦费罗尼手术的性能.
- 使用M1和M2选的特征的EBLR模型表现出最小的和更高的效率.
结论:
- 修改后的程序在处理测试统计相关性方面比BH和BY更具灵活性.
- 这些基于信息理论的方法有效地减少了对非信息特征的选,因为相关性增加.
- 拟议的程序提高了高维数据分析中的预测建模的效率.
更多相关视频
07:11Author Spotlight: Emerging Technologies and Advanced Tools for Decoding Metabolomics Data Analysis
Published on: November 10, 2023
11:35Screening for Functional Non-coding Genetic Variants Using Electrophoretic Mobility Shift Assay EMSA and DNA-affinity Precipitation Assay DAPA
Published on: August 21, 2016
相关概念视频
Comparing Copy Number Variations and SNPs
Copy number variations or CNVs are the structural variations that cover more than 1kb of DNA sequence. The single nucleotide polymorphism (SNP), on the other hand, is a single nucleotide change or a point mutation that is found in more than 1%...
Correlation of Experimental Data
For example, a spherical particle moving through a viscous fluid experiences drag. Dimensional analysis shows that the drag force depends on the particle's diameter, velocity,...
Genetic Variation
Genes exist in different versions called alleles,...
Expected Frequencies in Goodness-of-Fit Tests
Genetic Drift
Mutation, Gene Flow, and Genetic Drift
