Optimizing metaproteomics database construction: lessons from a study of the vaginal microbiome
Elliot M Lee1,2, Sujatha Srinivasan1, Samuel O Purvine3
1Fred Hutchinson Cancer Research Center , Seattle, Washington, DC, USA.
Msystems
|June 23, 2023
Summary
Optimizing metaproteomic analysis requires careful database selection. Hybrid, sample-matched databases significantly improve protein identification accuracy and biological insights in cervicovaginal lavage samples.
Area of Science:
- Microbiology
- Proteomics
- Bioinformatics
Background:
- Metaproteomics enables functional insights into microbial communities by identifying proteins.
- Database composition critically influences peptide identification in metaproteomic analyses.
- Optimizing metaproteomic workflows is essential for increasing usable data output.
Purpose of the Study:
- To compare the performance of six different protein database construction strategies for metaproteomic analysis.
- To evaluate the impact of database size and origin (sample-matched vs. public repositories) on peptide identification.
- To determine the optimal database strategy for accurate protein identification in cervicovaginal lavage (CVL) samples.
Main Methods:
- Utilized cervicovaginal lavage (CVL) samples from a bacterial vaginosis (BV) study.
- Compared databases built with six distinct strategies, including broad vs. sample-matched and metagenomic translation vs. public repositories.
- Evaluated hybrid databases combining NCBI RefSeq proteins and sample-derived metagenomic translations.
Main Results:
- Smaller, sample-matched databases significantly outperformed larger ones due to statistical constraints.
- Large databases incorrectly attributed up to 34% of bacterial hits to absent taxa.
- Hybrid databases integrating public and sample-specific data yielded the best results, identifying ~30% more proteins than typical databases.
Conclusions:
- Database composition and size are critical factors influencing metaproteomic results.
- Hybrid, sample-matched databases offer superior performance for accurate protein identification.
- Findings guide optimal database selection for robust metaproteomic analysis and biological conclusions.


