从基因组数据集估计氨基酸替代模型:对估计模型性能进行模拟研究
Nguyen Huy Tinh1, Cuong Cao Dang1, Le Sy Vinh1
1Faculty of Information Technology, University of Engineering and Technology, Vietnam National University, Hanoi, Vietnam.
Journal of evolutionary biology
|February 17, 2024
概括
使用最大概率 (ML) 方法估计氨基酸替代模型需要大量数据集. 来自100多个基因的模型与真实模型具有很高的相关性,并且在遗传树结构中可靠地执行.
科学领域:
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
- 进化遗传学 进化遗传学
背景情况:
- 准确的氨基酸替代模型对于植物遗传学分析至关重要.
- 最大概率 (ML) 是一种常见的模型估计方法.
- 评估ML估计模型的可靠性和数据要求至关重要.
研究的目的:
- 评估ML估计的氨基酸替代模型与真实模型之间的相关性.
- 为了确定可靠的模型估计所需的数据集大小.
- 评估基因树结构中估计模型的性能.
主要方法:
- 使用不同数量的基因/对齐的基因组数据集进行模拟研究.
- 基于预定义的"真实"模型和"真实"系谱树生成数据.
- 通过模拟数据集的ML方法对氨基酸替代模型的估计.
主要成果:
- 从具有> 100个基因的数据集中使用ML估计的氨基酸替代模型与真实模型具有很高的相关性.
- 估计模型在构建ML树时显示了与真实模型相比较的性能.
- 有足够大的基因组数据集可以实现可靠的模型估计.
结论:
- 基于ML的氨基酸替代模型估计对于大型基因组数据集是可靠的.
- 该研究提供了对准确模型参数估计的数据要求的见解.
- 估计模型是分析氨基酸序列演变的有效工具.


