{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,3,12]],"date-time":"2024-03-12T14:58:09Z","timestamp":1710255489161},"reference-count":25,"publisher":"Oxford University Press (OUP)","issue":"13","license":[{"start":{"date-parts":[[2016,10,2]],"date-time":"2016-10-02T00:00:00Z","timestamp":1475366400000},"content-version":"vor","delay-in-days":2719,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc\/2.0\/uk\/"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2009,7,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:p>Motivation: While profile hidden Markov models (HMMs) are successful and powerful methods to recognize homologous proteins, they can break down when homology becomes too distant due to lack of sufficient training data. We show that we can improve the performance of HMMs in this domain by using a simple simulated model of evolution to create an augmented training set.<\/jats:p>\n               <jats:p>Results: We show, in two different remote protein homolog tasks, that HMMs whose training is augmented with simulated evolution outperform HMMs trained only on real data. We find that a mutation rate between 15 and 20% performs best for recognizing G-protein coupled receptor proteins in different classes, and for recognizing SCOP super-family proteins from different families.<\/jats:p>\n               <jats:p>Contacts: \u00a0anoop.kumar@tufts.edu;lenore.cowen@tufts.edu<\/jats:p>","DOI":"10.1093\/bioinformatics\/btp265","type":"journal-article","created":{"date-parts":[[2009,4,24]],"date-time":"2009-04-24T00:25:34Z","timestamp":1240532734000},"page":"1602-1608","source":"Crossref","is-referenced-by-count":27,"title":["Augmented training of hidden Markov models to recognize remote homologs via simulated evolution"],"prefix":"10.1093","volume":"25","author":[{"given":"Anoop","family":"Kumar","sequence":"first","affiliation":[{"name":"Department of Computer Science, Tufts University, Medford, MA, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lenore","family":"Cowen","sequence":"additional","affiliation":[{"name":"Department of Computer Science, Tufts University, Medford, MA, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2009,4,23]]},"reference":[{"key":"2023013112135092200_B1","doi-asserted-by":"crossref","first-page":"403","DOI":"10.1016\/S0022-2836(05)80360-2","article-title":"Basic local alignment search tool","volume":"215","author":"Altschul","year":"1990","journal-title":"J. Mol. Biol."},{"key":"2023013112135092200_B2","doi-asserted-by":"crossref","first-page":"D189","DOI":"10.1093\/nar\/gkh034","article-title":"The ASTRAL compendium in 2004","volume":"32","author":"Chandonia","year":"2004","journal-title":"Nucleic Acids Res."},{"key":"2023013112135092200_B3","doi-asserted-by":"crossref","first-page":"955","DOI":"10.1002\/prot.20373","article-title":"Protein classification based on text document classification techniques","volume":"58","author":"Cheng","year":"2005","journal-title":"Proteins Struct. Funct. Bioinform."},{"key":"2023013112135092200_B4","doi-asserted-by":"crossref","first-page":"755","DOI":"10.1093\/bioinformatics\/14.9.755","article-title":"Profile hidden Markov models","volume":"14","author":"Eddy","year":"1998","journal-title":"Bioinformatics"},{"key":"2023013112135092200_B5","author":"Eddy","year":"1998","journal-title":"HMMER: biosequence analysis using profile hidden Markov models."},{"key":"2023013112135092200_B6","doi-asserted-by":"crossref","first-page":"1035","DOI":"10.1038\/nbt0804-1035","article-title":"Where did the BLOSUM62 alignment score matrix come from?","volume":"22","author":"Eddy","year":"2004","journal-title":"Nat. Biotechnol."},{"key":"2023013112135092200_B7","doi-asserted-by":"crossref","first-page":"1792","DOI":"10.1093\/nar\/gkh340","article-title":"MUSCLE: multiple sequence alignment with high accuracy and high throughput","volume":"32","author":"Edgar","year":"2004","journal-title":"Nucleic Acids Res"},{"key":"2023013112135092200_B8","doi-asserted-by":"crossref","first-page":"D247","DOI":"10.1093\/nar\/gkj149","article-title":"Pfam: clans, web tools and services","volume":"34","author":"Finn","year":"2006","journal-title":"Nucleic Acids Res"},{"key":"2023013112135092200_B9","doi-asserted-by":"crossref","first-page":"1067","DOI":"10.1016\/0022-2836(94)90012-4","article-title":"Volume changes in protein evolution","volume":"236","author":"Gerstein","year":"1994","journal-title":"J. Mol. Biol"},{"key":"2023013112135092200_B10","first-page":"191","volume-title":"G-protein coupled receptors or the power of data. Genomics and Proteomics: Functional and Computational Aspects.","author":"Horn","year":"2000"},{"key":"2023013112135092200_B11","first-page":"95","article-title":"Hidden Markov models for sequence analysis: extension and analysis of the basic method","volume":"12","author":"Hughey","year":"1996","journal-title":"Comput. Appl. Biosci."},{"key":"2023013112135092200_B12","doi-asserted-by":"crossref","first-page":"D227","DOI":"10.1093\/nar\/gkj063","article-title":"The PROSITE database","volume":"34","author":"Hulo","year":"2006","journal-title":"Nucleic Acids Res"},{"key":"2023013112135092200_B13","doi-asserted-by":"crossref","first-page":"95","DOI":"10.1089\/10665270050081405","article-title":"A discriminative framework for detecting remote protein homologies","volume":"7","author":"Jaakkola","year":"2000","journal-title":"J. Computing Biol."},{"key":"2023013112135092200_B14","article-title":"Remote protein homology detection using hidden Markov models","volume-title":"PhD Thesis.","author":"Johnson","year":"2006"},{"key":"2023013112135092200_B15","doi-asserted-by":"crossref","first-page":"147","DOI":"10.1093\/bioinformatics\/18.1.147","article-title":"Classifying G-protein coupled receptors with support vector machines","volume":"18","author":"Karchin","year":"2002","journal-title":"Bioinformatics"},{"key":"2023013112135092200_B16","doi-asserted-by":"crossref","first-page":"846","DOI":"10.1093\/bioinformatics\/14.10.846","article-title":"Hidden Markov models for detecting remote protein homologies","volume":"14","author":"Karplus","year":"1998","journal-title":"Bioinformatics"},{"key":"2023013112135092200_B17","first-page":"215","article-title":"Maximum entropy weighting of aligned sequences of proteins or DNA","volume":"3","author":"Krogh","year":"1995","journal-title":"Proc. Int. Conf Intell. Syst. Mol. Biol."},{"key":"2023013112135092200_B18","doi-asserted-by":"crossref","first-page":"536","DOI":"10.1016\/S0022-2836(05)80134-2","article-title":"SCOP: a structural classification of proteins database for the investigation of sequences and structures","volume":"247","author":"Murzin","year":"1995","journal-title":"J. Mol. Biol"},{"key":"2023013112135092200_B19","doi-asserted-by":"crossref","first-page":"649","DOI":"10.1007\/BF00125323","article-title":"A common motif in G-protein-coupled seven transmembrane helix receptors","volume":"7","author":"Oliveira","year":"1993","journal-title":"J. Comput. Aided Mol. Des."},{"key":"2023013112135092200_B20","doi-asserted-by":"crossref","first-page":"63","DOI":"10.1016\/0076-6879(90)83007-V","article-title":"Rapid and sensitive sequence comparisons with FASTP and FASTA","volume":"183","author":"Pearson","year":"1990","journal-title":"Methods Enzymol."},{"key":"2023013112135092200_B21","first-page":"199","article-title":"ROC analysis: applications to the classification of biological sequences and 3D structures","volume":"9","author":"Sonego","year":"2007","journal-title":"Brief. Bioinform."},{"key":"2023013112135092200_B22","doi-asserted-by":"crossref","first-page":"104","DOI":"10.1186\/1471-2105-8-104","article-title":"HMM-ModE \u2013 improved classification using profile hidden Markov models by optimising the discrimination threshold and modifying emission probabilities with negative training sequences","volume":"8","author":"Srivastava","year":"2007","journal-title":"BMC Bioinformatics"},{"key":"2023013112135092200_B23","doi-asserted-by":"crossref","first-page":"D308","DOI":"10.1093\/nar\/gkl910","article-title":"The SUPERFAMILY database in 2007: families and functions","author":"Wilson","year":"2007","journal-title":"Nucleic Acids Res."},{"key":"2023013112135092200_B24","doi-asserted-by":"crossref","first-page":"847","DOI":"10.1016\/j.jmb.2004.03.023","article-title":"Improving profile HMM discrimination by adapting transition probabilities","volume":"338","author":"Wistrand","year":"2004","journal-title":"J. Mol. Biol"},{"key":"2023013112135092200_B25","doi-asserted-by":"crossref","first-page":"99","DOI":"10.1186\/1471-2105-6-99","article-title":"Improved profile HMM performance by assessment of critical algorithmic features in SAM and HMMER","volume":"6","author":"Wistrand","year":"2005","journal-title":"BMC Bioinformatics"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/25\/13\/1602\/48996791\/bioinformatics_25_13_1602.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/25\/13\/1602\/48996791\/bioinformatics_25_13_1602.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,31]],"date-time":"2023-01-31T21:43:46Z","timestamp":1675201426000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/25\/13\/1602\/195842"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2009,4,23]]},"references-count":25,"journal-issue":{"issue":"13","published-print":{"date-parts":[[2009,7,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btp265","relation":{},"ISSN":["1367-4811","1367-4803"],"issn-type":[{"value":"1367-4811","type":"electronic"},{"value":"1367-4803","type":"print"}],"subject":[],"published-other":{"date-parts":[[2009,7,1]]},"published":{"date-parts":[[2009,4,23]]}}}