{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,17]],"date-time":"2026-05-17T00:53:05Z","timestamp":1778979185417,"version":"3.51.4"},"reference-count":22,"publisher":"Springer Science and Business Media LLC","issue":"1","content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["BMC Bioinformatics"],"published-print":{"date-parts":[[2013,12]]},"abstract":"<jats:title>Abstract<\/jats:title>\n          <jats:sec>\n            <jats:title>Background<\/jats:title>\n            <jats:p>In protein sequence classification, identification of the sequence motifs or <jats:italic>n<\/jats:italic>-grams that can precisely discriminate between classes is a more interesting scientific question than the classification itself. A number of classification methods aim at accurate classification but fail to explain which sequence features indeed contribute to the accuracy. We hypothesize that sequences in lower denominations (<jats:italic>n<\/jats:italic>-grams) can be used to explore the sequence landscape and to identify class-specific motifs that discriminate between classes during classification. Discriminative <jats:italic>n<\/jats:italic>-grams are short peptide sequences that are highly frequent in one class but are either minimally present or absent in other classes. In this study, we present a new substitution-based scoring function for identifying discriminative <jats:italic>n<\/jats:italic>-grams that are highly specific to a class.<\/jats:p>\n          <\/jats:sec>\n          <jats:sec>\n            <jats:title>Results<\/jats:title>\n            <jats:p>We present a scoring function based on discriminative <jats:italic>n<\/jats:italic>-grams that can effectively discriminate between classes. The scoring function, initially, harvests the entire set of 4- to 8-grams from the protein sequences of different classes in the dataset. Similar <jats:italic>n<\/jats:italic>-grams of the same size are combined to form new <jats:italic>n-<\/jats:italic> grams, where the similarity is defined by positive amino acid substitution scores in the BLOSUM62 matrix. Substitution has resulted in a large increase in the number of discriminatory <jats:italic>n<\/jats:italic>-grams harvested. Due to the unbalanced nature of the dataset, the frequencies of the <jats:italic>n<\/jats:italic>-grams are normalized using a dampening factor, which gives more weightage to the <jats:italic>n<\/jats:italic>-grams that appear in fewer classes and vice-versa. After the <jats:italic>n<\/jats:italic>-grams are normalized, the scoring function identifies discriminative 4- to 8-grams for each class that are frequent enough to be above a selection threshold. By mapping these discriminative <jats:italic>n<\/jats:italic>-grams back to the protein sequences, we obtained contiguous <jats:italic>n<\/jats:italic>-grams that represent short class-specific motifs in protein sequences. Our method fared well compared to an existing motif finding method known as Wordspy. We have validated our enriched set of class-specific motifs against the functionally important motifs obtained from the NLSdb, Prosite and ELM databases. We demonstrate that this method is very generic; thus can be widely applied to detect class-specific motifs in many protein sequence classification tasks.<\/jats:p>\n          <\/jats:sec>\n          <jats:sec>\n            <jats:title>Conclusion<\/jats:title>\n            <jats:p>The proposed scoring function and methodology is able to identify class-specific motifs using discriminative <jats:italic>n<\/jats:italic>-grams derived from the protein sequences. The implementation of amino acid substitution scores for similarity detection, and the dampening factor to normalize the unbalanced datasets have significant effect on the performance of the scoring function. Our multipronged validation tests demonstrate that this method can detect class-specific motifs from a wide variety of protein sequence classes with a potential application to detecting proteome-specific motifs of different organisms.<\/jats:p>\n          <\/jats:sec>","DOI":"10.1186\/1471-2105-14-96","type":"journal-article","created":{"date-parts":[[2013,3,15]],"date-time":"2013-03-15T07:54:43Z","timestamp":1363334083000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":21,"title":["Mining for class-specific motifs in protein sequence classification"],"prefix":"10.1186","volume":"14","author":[{"given":"Satish M","family":"Srinivasan","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Suleyman","family":"Vural","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Brian R","family":"King","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chittibabu","family":"Guda","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2013,3,15]]},"reference":[{"key":"5758_CR1","volume-title":"BMC Bioinformatics","author":"B Liu","year":"2008","unstructured":"Liu B, Wang X, Lin L, Dong Q, Wang X: A discriminative method for protein remote homology detection and fold recognition combining Top- n -grams and latent semantic analysis. BMC Bioinformatics 2008.,9(5):"},{"key":"5758_CR2","doi-asserted-by":"publisher","first-page":"1658","DOI":"10.1093\/bioinformatics\/btl158","volume":"22","author":"W Li","year":"2006","unstructured":"Li W, Godzik A: Cd-hit: a fast program for clustering and comparing large sets of protein or nucleotide sequences. Bioinformatics 2006, 22: 1658-1659. 10.1093\/bioinformatics\/btl158","journal-title":"Bioinformatics"},{"key":"5758_CR3","volume-title":"Genome Biology","author":"BR King","year":"2007","unstructured":"King BR, Guda C: ngLOC: an n -gram-based Bayesian method for estimating the subcellular proteomes of eukaryotes. Genome Biology 2007.,8(R68):"},{"key":"5758_CR4","first-page":"76","volume-title":"Proceedings of HLT","author":"MK Ganapathiraju","year":"2002","unstructured":"Ganapathiraju MK, Weisser D, Rosenfeld R, Carbonell J, Reddy R, Klein-Seetharaman J: Comparative n -gram analysis of whole-genome protein sequences. Proceedings of HLT 2002, 76-81."},{"issue":"6","key":"5758_CR5","doi-asserted-by":"publisher","first-page":"737","DOI":"10.1093\/bioinformatics\/btq042","volume":"26","author":"SR Maetschke","year":"2010","unstructured":"Maetschke SR, Kassahn KS, Dunn JA, Han SP, Curley EZ, Stacey KJ, Ragan MA: A visual framework for sequence analysis using n -grams and spectral rearrangement. Bioinformatics 2010,26(6):737-744. 10.1093\/bioinformatics\/btq042","journal-title":"Bioinformatics"},{"key":"5758_CR6","volume-title":"BMC Bioinformatics","author":"JK Vries","year":"2008","unstructured":"Vries JK, Liu X: Subfamily specific conservation profiles for proteins based on n -gram patterns. BMC Bioinformatics 2008.,9(72):"},{"key":"5758_CR7","doi-asserted-by":"publisher","first-page":"193","DOI":"10.2165\/00822942-200403020-00013","volume":"3","author":"MK Ganapathiraju","year":"2004","unstructured":"Ganapathiraju MK, Manoharan V, Klein-Seetharaman J: BLMT Statistical Sequence Analysis Using N -Grams. Appl Bioinformatics 2004, 3: 193-200. 10.2165\/00822942-200403020-00013","journal-title":"Appl Bioinformatics"},{"key":"5758_CR8","volume-title":"BMC Bioinformatics","author":"UH Osmanbeyoglu","year":"2011","unstructured":"Osmanbeyoglu UH, Ganapathiraju MK: N-gram analysis of 970 microbial organisms reveals presence of biological language models. BMC Bioinformatics 2011., 12:"},{"key":"5758_CR9","doi-asserted-by":"publisher","first-page":"1","DOI":"10.2174\/1874136300903010001","volume":"3","author":"BR King","year":"2009","unstructured":"King BR, Latham L, Guda C: Estimation of Subcellular Proteomes in bacterial Species. The Open Applied Informatics Journal 2009, 3: 1-11.","journal-title":"The Open Applied Informatics Journal"},{"key":"5758_CR10","doi-asserted-by":"publisher","first-page":"W412","DOI":"10.1093\/nar\/gki492","volume":"33","author":"G Wang","year":"2005","unstructured":"Wang G, Yu T, Zhang W: WordSpy: Identifying transcription factor binding motifs by building a dictionary and learning a grammar. Nucleic Acids Research 2005, 33: W412-W416. 10.1093\/nar\/gki492","journal-title":"Nucleic Acids Research"},{"issue":"4","key":"5758_CR11","doi-asserted-by":"publisher","first-page":"467","DOI":"10.1093\/bioinformatics\/btg431","volume":"20","author":"SC Leslie","year":"2004","unstructured":"Leslie SC, Eskin E, Cohen A, Weston J, Noble WS: Mismatch string kernels for discriminative protein classification. Bioinformatics 2004,20(4):467-476. 10.1093\/bioinformatics\/btg431","journal-title":"Bioinformatics"},{"issue":"1","key":"5758_CR12","first-page":"1","volume":"6","author":"H Xiong","year":"2011","unstructured":"Xiong H, Capurso D, Sen S, Segal MR: Sequence-Based Classification Using Discriminatory Motif Feature Selection. PLoS One 2011,6(1):1-7.","journal-title":"PLoS One"},{"issue":"1","key":"5758_CR13","doi-asserted-by":"publisher","first-page":"397","DOI":"10.1093\/nar\/gkg001","volume":"31","author":"R Nair","year":"2003","unstructured":"Nair R, Carter P, Rost B: NLSdb: database of nuclear localization signals. Nucleic Acids Research 2003,31(1):397-399. 10.1093\/nar\/gkg001","journal-title":"Nucleic Acids Research"},{"issue":"3","key":"5758_CR14","doi-asserted-by":"publisher","first-page":"633","DOI":"10.1016\/j.bbrc.2007.03.162","volume":"357","author":"KC Chou","year":"2007","unstructured":"Chou KC, Shen HB: Signal-CF: A subsite-coupled and window-fusing approach for predicting signal peptides. Biochemical and Biophysical Research Communications 2007,357(3):633-640. 10.1016\/j.bbrc.2007.03.162","journal-title":"Biochemical and Biophysical Research Communications"},{"issue":"10","key":"5758_CR15","doi-asserted-by":"publisher","first-page":"563","DOI":"10.1016\/j.tibs.2006.08.004","volume":"31","author":"RS Hegde","year":"2006","unstructured":"Hegde RS, Bernstein HD: The surprising complexity of signal sequences. Trends Biochem Science 2006,31(10):563-571. 10.1016\/j.tibs.2006.08.004","journal-title":"Trends Biochem Science"},{"issue":"2","key":"5758_CR16","doi-asserted-by":"publisher","first-page":"210","DOI":"10.1016\/S1369-5274(00)00077-1","volume":"3","author":"JM Hermann","year":"2000","unstructured":"Hermann JM, Neupert W: Protein transport into mitochondria. Curr Opin Microbiol 2000,3(2):210-214. 10.1016\/S1369-5274(00)00077-1","journal-title":"Curr Opin Microbiol"},{"issue":"22","key":"5758_CR17","doi-asserted-by":"publisher","first-page":"10915","DOI":"10.1073\/pnas.89.22.10915","volume":"89","author":"S Henikoff","year":"1992","unstructured":"Henikoff S, Henikoff JG: Amino Acid Substitution Matrices from Protein Blocks. PNAS 1992,89(22):10915-10919. 10.1073\/pnas.89.22.10915","journal-title":"PNAS"},{"key":"5758_CR18","doi-asserted-by":"publisher","first-page":"403","DOI":"10.1016\/S0022-2836(05)80360-2","volume":"215","author":"SF Altschul","year":"1990","unstructured":"Altschul SF, Gish W, Miller W, Myers EW, Lipman DJ: Basic local alignment search tool. Journal Molecular Biology 1990, 215: 403-410.","journal-title":"Journal Molecular Biology"},{"key":"5758_CR19","doi-asserted-by":"publisher","first-page":"5","DOI":"10.1155\/2008\/795010","volume":"16","author":"BR King","year":"2008","unstructured":"King BR, Guda C: Semi-supervised learning for classification of protein sequence data. Scientific Programming 2008, 16: 5-29.","journal-title":"Scientific Programming"},{"issue":"1","key":"5758_CR20","first-page":"D281","volume":"36","author":"RD Finn","year":"2008","unstructured":"Finn RD, Tate J, Mistry J, Coggil PC, Sammut SJ, Hotz HR, Ceric G, Forslund K, Eddy SR, Sonnhammer ELL, Bateman A: The Pfam protein families database. Nucleic Acids Research 2008,36(1):D281-D288.","journal-title":"Nucleic Acids Research"},{"key":"5758_CR21","volume-title":"Modeling the Internet and the Web","author":"P Baldi","year":"2003","unstructured":"Baldi P: Modeling the Internet and the Web. John Wiley & Sons; 2003."},{"issue":"11","key":"5758_CR22","doi-asserted-by":"publisher","first-page":"1410","DOI":"10.1093\/bioinformatics\/btm115","volume":"23","author":"H Shatkay","year":"2007","unstructured":"Shatkay H, Hoglund A, Brady S, Blum T, Donnes P, Kohlbacher O: SherLoc: High-accuracy prediction of protein subcellular localization by integrating text and protein sequence data. Bioinformatics 2007,23(11):1410-1417. 10.1093\/bioinformatics\/btm115","journal-title":"Bioinformatics"}],"container-title":["BMC Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/1471-2105-14-96.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,9,1]],"date-time":"2021-09-01T22:48:23Z","timestamp":1630536503000},"score":1,"resource":{"primary":{"URL":"https:\/\/bmcbioinformatics.biomedcentral.com\/articles\/10.1186\/1471-2105-14-96"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2013,3,15]]},"references-count":22,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2013,12]]}},"alternative-id":["5758"],"URL":"https:\/\/doi.org\/10.1186\/1471-2105-14-96","relation":{},"ISSN":["1471-2105"],"issn-type":[{"value":"1471-2105","type":"electronic"}],"subject":[],"published":{"date-parts":[[2013,3,15]]},"assertion":[{"value":"9 May 2012","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 December 2012","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 March 2013","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"96"}}