Related Experiment Video
Updated: Oct 22, 2025

Heuristic Mining of Hierarchical Genotypes and Accessory Genome Loci in Bacterial Populations
Published on: December 7, 2021
Nonrandom missing data can bias Principal Component Analysis inference of population genetic structure
1Behavioral and Molecular Ecology Research Group, Department of Biological Sciences, University of Wisconsin-Milwaukee, Milwaukee, Wisconsin, USA.
Missing data in population genetics can distort principal component analysis (PCA) results. Biased missingness in individuals can falsely suggest admixture, impacting population structure interpretation.
Area of Science:
- Population genetics
- Genomics
- Bioinformatics
Background:
- Next-generation sequencing (NGS) generates substantial missing data in population genetics studies.
- Principal Component Analysis (PCA) is a common tool for visualizing population structure, often using mean imputation for missing data.
Purpose of the Study:
- To investigate the impact of missing data, particularly nonrandomly distributed missingness, on PCA in population genetic analyses.
- To evaluate how biased missing data affects the interpretation of population structure in both simulated and empirical datasets.
Main Methods:
- Simulated population genetic data with varying levels and patterns of missingness (random vs. biased).
- Empirical data from big brown bat (Eptesicus fuscus) using restriction site-associated DNA sequencing (RADseq) with different missing data filters.
- Principal Component Analysis (PCA) applied to simulated and empirical datasets.
Main Results:
- Biased missing data in individuals shifts them towards the origin in PCA plots, mimicking admixed individuals.
- This effect was observed in both simulated data and empirical RADseq data from big brown bats.
- Nonrandom missing data is common in non-model organisms due to sample quality variations.
Conclusions:
- Missing data, especially when nonrandomly distributed, can significantly bias PCA results and lead to misinterpretation of population structure.
- Researchers should carefully consider and visualize missing data patterns when using PCA in population genetics.
- Recommendations include plotting PCA with missingness gradients, cautious interpretation of central samples, and using complementary analyses for validation.
Related Concept Videos
Genetic Drift
Hardy-Weinberg Principle
Mechanistic Models: Compartment Models in Individual and Population Analysis
What is Population Genetics?
Analysis of Population Pharmacokinetic Data
Mutation, Gene Flow, and Genetic Drift

