Related Experiment Videos
Representation of amino acids as five-bit or three-bit patterns for filtering protein databases
A Coghlan1, D A Mac Dónaill, N H Buttimore
1Department of Genetics, University of Dublin, Trinity College, Dublin 2, Ireland.
Bioinformatics (Oxford, England)
|August 29, 2001
Summary
New bit-patterns represent amino acids for faster protein database similarity searches. This method improves upon existing filters by distinguishing conservative amino acid substitutions, enhancing alignment accuracy.
Area of Science:
- Bioinformatics
- Computational Biology
- Molecular Biology
Background:
- Developing efficient methods for protein database similarity searches is crucial for bioinformatics.
- Existing filter algorithms for sequence alignment lack nuanced scoring of amino acid substitutions.
- Representing amino acids using bit-patterns offers a novel approach to accelerate similarity searches.
Purpose of the Study:
- To develop and evaluate a novel bit-pattern representation for amino acids.
- To implement a filter algorithm based on dynamic programming optimization for rapid elimination of non-homologous protein sequences.
- To enhance similarity searches by distinguishing between conservative and non-conservative amino acid substitutions.
Main Methods:
- Amino acid similarity was assessed using the BLOSUM45 matrix.
- Simulated annealing was employed to determine optimal five-bit and three-bit patterns for amino acid representation.
- The developed bit-pattern representation was tested using dynamic programming for sequence alignment.
Main Results:
- Optimal five-bit and three-bit patterns were identified, assigning similar bit-patterns to biochemically similar amino acids.
- Alignments of the Escherichia coli PhoE precursor and bacteriophage PA2 LC precursor using bit-patterns closely matched those obtained with the BLOSUM45 matrix.
- The proposed filter algorithm effectively eliminated non-homologous regions, demonstrating improved efficiency.
Conclusions:
- Bit-pattern representation provides an effective method for accelerating protein similarity searches in large databases.
- The developed algorithm enhances sequence alignment by incorporating a more sophisticated scoring function for amino acid substitutions.
- This approach offers a valuable tool for computational biology and bioinformatics research.