一种重新采样和视觉评估方法,用于在生物分子序列分析过程中检测和绘制局部模型违规情况
Meijun Gao1, Kevin J Liu1,2,3
1Department of Computer Science and Engineering, Michigan State University, East Lansing, Michigan, USA.
概括
REVEAL是一种新的统计框架,可以检测和确定进化模型错误指定生物分子序列数据的位置. 该工具通过识别局部模型违规行为来改进家族遗传学和家族遗传学分析.
科学领域:
- 进化生物学是进化生物学.
- 生物信息学是一种生物信息学.
- 计算生物学是一种计算生物学.
背景情况:
- 遗传学和遗传学假定所有序列地点都有一个单一的进化模型.
- 这种假设经常被进化过程异质性所违反,导致局部模型的错误规范和推理偏差.
- 解决这个问题的现有方法在概括性和模型假设方面存在局限性.
研究的目的:
- 引入REVEAL (再采样和视觉评估),一个一般的统计框架.
- 在不添加新的假设的情况下,检测和定位生物分子序列数据中的模型错误规范.
- 提供灵活和有效的工具,用于评估家族遗传学分析中的模型充分性.
主要方法:
- REVEAL采用了顺序意识的统计重新抽样.
- 它沿着序列对齐构建了一个局部支持矩阵.
- 这有助于识别网站级模型违规行为.
主要成果:
- 在模拟中,REVEAL 证明了对 I 型和 II 型错误的可靠控制.
- 在各种进化场景中达到>90%的精度和>85%的回忆.
- 在老鼠和蚊子基因组数据中成功识别了局部模型违规.
结论:
- REVEAL是一个通用框架,用于检测序列数据中的模型错误规范.
- 它提高了遗传学和遗传学推断的可靠性.
- 该工具在各种进化背景和数据集大小中有效.


