同时估计全基因组序列数据中的基因型错误和意外删除率
Nobuaki Masaki1, Sharon R Browning1, Brian L Browning1,2
1Department of Biostatistics, University of Washington, Seattle, Washington, United States of America.
PLoS genetics
|May 24, 2024
概括
基因型错误模型可能会被无意删除所影响. 这项研究引入了一个新的模型来计算这些删除,提高了人类遗传数据分析中基因型错误率的准确性.
科学领域:
- 遗传学 是一个遗传学.
- 生物信息学是一种生物信息学.
- 统计基因组学 统计基因组学
背景情况:
- 基因型数据错误可能会影响统计分析.
- 现有的基因型错误率估计往往忽略了不必要的删除,这可能会导致结果偏见.
- 不必要的删除是遗传数据中错误的重要,但尚未解决的来源.
研究的目的:
- 开发一种新的基因型错误模型,包括基因型错误和无意删除.
- 为了提高基因型错误率估计在父子三人组的准确性.
- 评估意外删除对基因型错误率计算的影响.
主要方法:
- 提出了一个新的基因型错误模型,计算父子三组中观察到的基因型的概率,考虑错误和删除.
- 利用模拟来比较新模型的偏差与没有删除会计的传统模型的偏差.
- 将模型应用于来自英国生物库的77个白人英国父母-后代三重组的单核酸变体 (SNV).
主要成果:
- 模拟表明,当有无需删除时,拟议的模型产生了较少偏差的基因型错误率估计.
- 与传统模型相比,Akaike信息标准表明,新模型适合的数据优于传统模型.
- 在英国生物库数据中,SNV (小等位基因频率>0.001) 的基因型误差率估计为[公式:见文本].
结论:
- 不必要的删除在很大程度上导致了基因型错误,估计占特定标记器错误的77%.
- 开发的基因型错误模型通过包括不必要的删除来提供更准确的错误率评估.
- 这种改进的建模对于基因研究中可靠的下游统计分析至关重要.


