{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,18]],"date-time":"2026-08-18T02:20:39Z","timestamp":1787019639046,"version":"build-2736575974"},"reference-count":63,"publisher":"Springer Science and Business Media LLC","issue":"1","content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["BMC Bioinformatics"],"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:sec>\n                    <jats:title>Background<\/jats:title>\n                    <jats:p>Whole-genome sequencing projects are rapidly producing an enormous number of new sequences. Consequently almost every family of proteins now contains hundreds of members. It has thus become necessary to develop tools, which classify protein sequences automatically and also quickly and reliably. The difficulty of this task is intimately linked to the mechanism by which protein sequences diverge, i.e. by simultaneous residue substitutions, insertions and\/or deletions and whole domain reorganisations (duplications\/swapping\/fusion).<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Results<\/jats:title>\n                    <jats:p>Here we present a novel approach, which is based on random sampling of sub-sequences (probes) out of a set of input sequences. The probes are compared to the input sequences, after a normalisation step; the results are used to partition the input sequences into homogeneous groups of proteins. In addition, this method provides information on diagnostic parts of the proteins. The performance of this method is challenged by two data sets. The first one contains the sequences of prokaryotic lyases that could be arranged as a multiple sequence alignment. The second one contains all proteins from Swiss-Prot Release 36 with at least one Src homology 2 (SH2) domain \u2013 a classical example for proteins with modular architecture.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Conclusion<\/jats:title>\n                    <jats:p>The outcome of our method is robust, highly reproducible as shown using bootstrap and resampling validation procedures. The results are essentially coherent with the biology. This method depends solely on well-established publicly available software and algorithms.<\/jats:p>\n                  <\/jats:sec>","DOI":"10.1186\/1471-2105-6-216","type":"journal-article","created":{"date-parts":[[2005,8,31]],"date-time":"2005-08-31T14:13:33Z","timestamp":1125497613000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":23,"title":["JACOP: A simple and robust method for the automated classification of protein sequences with modular architecture"],"prefix":"10.1186","volume":"6","author":[{"given":"Peter","family":"Sperisen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Marco","family":"Pagni","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2005,8,31]]},"reference":[{"issue":"13","key":"541_CR1","doi-asserted-by":"publisher","first-page":"4355","DOI":"10.1073\/pnas.84.13.4355","volume":"84","author":"M Gribskov","year":"1987","unstructured":"Gribskov M, McLachlan AD, Eisenberg D: Profile analysis: detection of distantly related proteins. Proc Natl Acad Sci U S A 1987, 84(13):4355\u20134358.","journal-title":"Proc Natl Acad Sci U S A"},{"issue":"1","key":"541_CR2","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1016\/S0097-8485(96)80003-9","volume":"20","author":"P Bucher","year":"1996","unstructured":"Bucher P, Karplus K, Moeri N, Hofmann K: A flexible motif search technique based on generalized profiles. Comput Chem 1996, 20(1):3\u201323. 10.1016\/S0097-8485(96)80003-9","journal-title":"Comput Chem"},{"issue":"5","key":"541_CR3","doi-asserted-by":"publisher","first-page":"1501","DOI":"10.1006\/jmbi.1994.1104","volume":"235","author":"A Krogh","year":"1994","unstructured":"Krogh A, Brown M, Mian IS, Sjolander K, Haussler D: Hidden Markov models in computational biology. Applications to protein modeling. J Mol Biol 1994, 235(5):1501\u20131531. 10.1006\/jmbi.1994.1104","journal-title":"J Mol Biol"},{"issue":"Database issue","key":"541_CR4","doi-asserted-by":"publisher","first-page":"D134","DOI":"10.1093\/nar\/gkh044","volume":"32","author":"N Hulo","year":"2004","unstructured":"Hulo N, Sigrist CJ, Le Saux V, Langendijk-Genevaux PS, Bordoli L, Gattiker A, De Castro E, Bucher P, Bairoch A: Recent improvements to the PROSITE database. Nucleic Acids Res 2004, 32(Database issue):D134\u20137. 10.1093\/nar\/gkh044","journal-title":"Nucleic Acids Res"},{"issue":"Database issue","key":"541_CR5","doi-asserted-by":"publisher","first-page":"D138","DOI":"10.1093\/nar\/gkh121","volume":"32","author":"A Bateman","year":"2004","unstructured":"Bateman A, Coin L, Durbin R, Finn RD, Hollich V, Griffiths-Jones S, Khanna A, Marshall M, Moxon S, Sonnhammer EL, Studholme DJ, Yeats C, Eddy SR: The Pfam protein families database. Nucleic Acids Res 2004, 32(Database issue):D138\u2013141. 10.1093\/nar\/gkh121","journal-title":"Nucleic Acids Res"},{"issue":"1","key":"541_CR6","doi-asserted-by":"publisher","first-page":"226","DOI":"10.1093\/nar\/27.1.226","volume":"27","author":"JG Henikoff","year":"1999","unstructured":"Henikoff JG, Henikoff S, Pietrokovski S: New features of the Blocks Database servers. Nucleic Acids Res 1999, 27(1):226\u2013228. 10.1093\/nar\/27.1.226","journal-title":"Nucleic Acids Res"},{"issue":"3","key":"541_CR7","doi-asserted-by":"publisher","first-page":"252","DOI":"10.1093\/bib\/3.3.252","volume":"3","author":"TK Attwood","year":"2002","unstructured":"Attwood TK: The PRINTS database: a resource for identification of protein families. Brief Bioinform 2002, 3(3):252\u2013263.","journal-title":"Brief Bioinform"},{"issue":"11","key":"541_CR8","doi-asserted-by":"publisher","first-page":"5865","DOI":"10.1073\/pnas.95.11.5865","volume":"95","author":"CG Nevill-Manning","year":"1998","unstructured":"Nevill-Manning CG, Wu TD, Brutlag DL: Highly specific protein sequence motifs for genome analysis. Proc Natl Acad Sci USA 1998, 95(11):5865\u20135871. 10.1073\/pnas.95.11.5865","journal-title":"Proc Natl Acad Sci USA"},{"issue":"Database issue","key":"541_CR9","doi-asserted-by":"publisher","first-page":"D212","DOI":"10.1093\/nar\/gki034","volume":"33","author":"C Bru","year":"2005","unstructured":"Bru C, Courcelle E, Carrere S, Beausse Y, Dalmar S, Kahn D: The ProDom database of protein domain families: more emphasis on 3D. Nucleic Acids Res 2005, 33(Database issue):D212\u2013205. 10.1093\/nar\/gki034","journal-title":"Nucleic Acids Res"},{"issue":"12","key":"541_CR10","doi-asserted-by":"publisher","first-page":"495","DOI":"10.1016\/S0968-0004(98)01294-8","volume":"23","author":"J Gracy","year":"1998","unstructured":"Gracy J, Argos P: DOMO: a new database of aligned protein domains. Trends Biochem Sci 1998, 23(12):495\u2013497. 10.1016\/S0968-0004(98)01294-8","journal-title":"Trends Biochem Sci"},{"issue":"Database issue","key":"541_CR11","doi-asserted-by":"publisher","first-page":"D142","DOI":"10.1093\/nar\/gkh088","volume":"32","author":"I Letunic","year":"2004","unstructured":"Letunic I, Copley RR, Schmidt S, Ciccarelli FD, Doerks T, Schultz J, Ponting CP, Bork P: SMART 4.0: towards genomic data integration. Nucleic Acids Res 2004, 32(Database issue):D142\u20134. 10.1093\/nar\/gkh088","journal-title":"Nucleic Acids Res"},{"issue":"Database issue","key":"541_CR12","doi-asserted-by":"publisher","first-page":"D188","DOI":"10.1093\/nar\/gki096","volume":"33","author":"A Heger","year":"2005","unstructured":"Heger A, Wilton CA, Sivakumar A, Holm L: ADDA: a domain database with global coverage of the protein universe. Nucleic Acids Res 2005, 33(Database issue):D188\u201391. 10.1093\/nar\/gki096","journal-title":"Nucleic Acids Res"},{"issue":"12","key":"541_CR13","doi-asserted-by":"publisher","first-page":"1234","DOI":"10.1093\/bioinformatics\/17.12.1234","volume":"17","author":"T Junier","year":"2001","unstructured":"Junier T, Pagni M, Bucher P: mmsearch: a motif arrangement language and search program. Bioinformatics 2001, 17(12):1234\u20131235. 10.1093\/bioinformatics\/17.12.1234","journal-title":"Bioinformatics"},{"issue":"1","key":"541_CR14","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1093\/nar\/27.1.229","volume":"27","author":"CP Ponting","year":"1999","unstructured":"Ponting CP, Schultz J, Milpetz F, Bork P: SMART: identification and annotation of domains from signalling and extracellular protein sequences. Nucleic Acids Res 1999, 27(1):229\u2013232. 10.1093\/nar\/27.1.229","journal-title":"Nucleic Acids Res"},{"issue":"2","key":"541_CR15","doi-asserted-by":"publisher","first-page":"47","DOI":"10.1016\/S0968-0004(98)01341-3","volume":"24","author":"L Aravind","year":"1999","unstructured":"Aravind L, Dixit VM, Koonin EV: The domains of death: evolution of the apoptosis machinery. Trends Biochem Sci 1999, 24(2):47\u201353. 10.1016\/S0968-0004(98)01341-3","journal-title":"Trends Biochem Sci"},{"issue":"5","key":"541_CR16","doi-asserted-by":"publisher","first-page":"1223","DOI":"10.1093\/nar\/27.5.1223","volume":"27","author":"L Aravind","year":"1999","unstructured":"Aravind L, Walker DR, Koonin EV: Conserved domains in DNA repair proteins and evolution of repair systems. Nucleic Acids Res 1999, 27(5):1223\u20131242. 10.1093\/nar\/27.5.1223","journal-title":"Nucleic Acids Res"},{"issue":"12","key":"541_CR17","doi-asserted-by":"publisher","first-page":"504","DOI":"10.1016\/S0962-8924(01)02154-7","volume":"11","author":"T Pawson","year":"2001","unstructured":"Pawson T, Gish GD, Nash P: SH2 domains, interaction modules and cellular wiring. Trends Cell Biol 2001, 11(12):504\u2013511. 10.1016\/S0962-8924(01)02154-7","journal-title":"Trends Cell Biol"},{"issue":"2","key":"541_CR18","doi-asserted-by":"publisher","first-page":"381","DOI":"10.1006\/jmbi.1999.2993","volume":"293","author":"IB Holland","year":"1999","unstructured":"Holland IB, Blight MA: ABC-ATPases, adaptable energy generators fuelling transmembrane movement of a variety of molecules in organisms from bacteria to humans. J Mol Biol 1999, 293(2):381\u2013399. 10.1006\/jmbi.1999.2993","journal-title":"J Mol Biol"},{"issue":"4","key":"541_CR19","first-page":"501","volume":"2","author":"Y Quentin","year":"2000","unstructured":"Quentin Y, Fichant G: ABCdb: an ABC transporter database. J Mol Microbiol Biotechnol 2000, 2(4):501\u2013504.","journal-title":"J Mol Microbiol Biotechnol"},{"key":"541_CR20","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1146\/annurev.cb.08.110192.000435","volume":"8","author":"CF Higgins","year":"1992","unstructured":"Higgins CF: ABC transporters: from microorganisms to man. Annu Rev Cell Biol 1992, 8: 67\u2013113. 10.1146\/annurev.cb.08.110192.000435","journal-title":"Annu Rev Cell Biol"},{"issue":"13","key":"541_CR21","doi-asserted-by":"publisher","first-page":"2850","DOI":"10.1093\/nar\/29.13.2850","volume":"29","author":"B Modrek","year":"2001","unstructured":"Modrek B, Resch A, Grasso C, Lee C: Genome-wide detection of alternative splicing in expressed sequences of human genes. Nucleic Acids Res 2001, 29(13):2850\u20132859. 10.1093\/nar\/29.13.2850","journal-title":"Nucleic Acids Res"},{"issue":"7","key":"541_CR22","doi-asserted-by":"publisher","first-page":"1575","DOI":"10.1093\/nar\/30.7.1575","volume":"30","author":"AJ Enright","year":"2002","unstructured":"Enright AJ, Van Dongen S, Ouzounis CA: An efficient algorithm for large-scale detection of protein families. Nucleic Acids Res 2002, 30(7):1575\u20131584. 10.1093\/nar\/30.7.1575","journal-title":"Nucleic Acids Res"},{"issue":"3","key":"541_CR23","doi-asserted-by":"publisher","first-page":"272","DOI":"10.1093\/bioinformatics\/17.3.272","volume":"17","author":"A Heger","year":"2001","unstructured":"Heger A, Holm L: Picasso: generating a covering set of protein family profiles. Bioinformatics 2001, 17(3):272\u2013279. 10.1093\/bioinformatics\/17.3.272","journal-title":"Bioinformatics"},{"issue":"Database issue","key":"541_CR24","doi-asserted-by":"publisher","first-page":"D226","DOI":"10.1093\/nar\/gki030","volume":"33","author":"T Meinel","year":"2005","unstructured":"Meinel T, Krause A, Luz H, Vingron M, Staub E: The SYSTERS Protein Family Database in 2005. Nucleic Acids Res 2005, 33(Database issue):D226\u20139. 10.1093\/nar\/gki030","journal-title":"Nucleic Acids Res"},{"issue":"1","key":"541_CR25","doi-asserted-by":"publisher","first-page":"41","DOI":"10.1186\/1471-2105-4-41","volume":"4","author":"RL Tatusov","year":"2003","unstructured":"Tatusov RL, Fedorova ND, Jackson JD, Jacobs AR, Kiryutin B, Koonin EV, Krylov DM, Mazumder R, Mekhedov SL, Nikolskaya AN, Rao BS, Smirnov S, Sverdlov AV, Vasudevan S, Wolf YI, Yin JJ, Natale DA: The COG database: an updated version includes eukaryotes. BMC Bioinformatics 2003, 4(1):41. 10.1186\/1471-2105-4-41","journal-title":"BMC Bioinformatics"},{"issue":"1","key":"541_CR26","doi-asserted-by":"publisher","first-page":"49","DOI":"10.1093\/nar\/28.1.49","volume":"28","author":"G Yona","year":"2000","unstructured":"Yona G, Linial N, Linial M: ProtoMap: automatic classification of protein sequences and hierarchy of protein families. Nucleic Acids Res 2000, 28(1):49\u201355. 10.1093\/nar\/28.1.49","journal-title":"Nucleic Acids Res"},{"issue":"Database issue","key":"541_CR27","doi-asserted-by":"publisher","first-page":"D216","DOI":"10.1093\/nar\/gki007","volume":"33","author":"N Kaplan","year":"2005","unstructured":"Kaplan N, Sasson O, Inbar U, Friedlich M, Fromer M, Fleischer H, Portugaly E, Linial N, Linial M: ProtoNet 4.0: a hierarchical classification of one million protein sequences. Nucleic Acids Res 2005, 33(Database issue):D216\u2013218. 10.1093\/nar\/gki007","journal-title":"Nucleic Acids Res"},{"issue":"1","key":"541_CR28","doi-asserted-by":"publisher","first-page":"388","DOI":"10.1093\/nar\/gkg035","volume":"31","author":"EV Kriventseva","year":"2003","unstructured":"Kriventseva EV, Servant F, Apweiler R: Improvements to CluSTr: the database of SWISS-PROT+TrEMBL protein clusters. Nucleic Acids Res 2003, 31(1):388\u2013389. 10.1093\/nar\/gkg035","journal-title":"Nucleic Acids Res"},{"issue":"1","key":"541_CR29","doi-asserted-by":"publisher","first-page":"273","DOI":"10.1093\/nar\/28.1.273","volume":"28","author":"H Huang","year":"2000","unstructured":"Huang H, Xiao C, Wu CH: ProClass protein family database. Nucleic Acids Res 2000, 28(1):273\u2013276. 10.1093\/nar\/28.1.273","journal-title":"Nucleic Acids Res"},{"issue":"4","key":"541_CR30","doi-asserted-by":"publisher","first-page":"513","DOI":"10.1093\/bioinformatics\/btg005","volume":"19","author":"S Vinga","year":"2003","unstructured":"Vinga S, Almeida J: Alignment-free sequence comparison-a review. Bioinformatics 2003, 19(4):513\u2013523. 10.1093\/bioinformatics\/btg005","journal-title":"Bioinformatics"},{"issue":"22","key":"541_CR31","doi-asserted-by":"publisher","first-page":"10915","DOI":"10.1073\/pnas.89.22.10915","volume":"89","author":"S Henikoff","year":"1992","unstructured":"Henikoff S, Henikoff JG: Amino acid substitution matrices from protein blocks. Proc Natl Acad Sci USA 1992, 89(22):10915\u201310919.","journal-title":"Proc Natl Acad Sci USA"},{"key":"541_CR32","unstructured":"Altschul SF: The Statistics of Sequence Similarity Scores.[http:\/\/www.ncbi.nlm.nih.gov\/BLAST\/tutorial\/Altschul-1.html]"},{"issue":"6","key":"541_CR33","doi-asserted-by":"publisher","first-page":"2264","DOI":"10.1073\/pnas.87.6.2264","volume":"87","author":"S Karlin","year":"1990","unstructured":"Karlin S, Altschul SF: Methods for assessing the statistical significance of molecular sequence features by using general scoring schemes. Proc Natl Acad Sci USA 1990, 87(6):2264\u20132268.","journal-title":"Proc Natl Acad Sci USA"},{"key":"541_CR34","doi-asserted-by":"publisher","first-page":"2022","DOI":"10.1214\/aop\/1176988493","volume":"22","author":"A Dembo","year":"1994","unstructured":"Dembo A, Karlin S, Zeitouni O: Limit distribution of maximal non-aligned two-sequence segmental score. Ann Prob 1994, 22: 2022\u20132039.","journal-title":"Ann Prob"},{"key":"541_CR35","first-page":"223","volume":"44","author":"P Jaccard","year":"1908","unstructured":"Jaccard P: Nouvelles recherches sur la distribution florale. Bull Soc Vaudoise Sci Nat 1908, 44: 223\u2013227.","journal-title":"Bull Soc Vaudoise Sci Nat"},{"key":"541_CR36","doi-asserted-by":"publisher","DOI":"10.1002\/9780470316801","volume-title":"Finding groups in data: An introduction to cluster analysis","author":"L Kaufman","year":"1990","unstructured":"Kaufman L, Rousseeuw PJ: Finding groups in data: An introduction to cluster analysis. New York , John Wiley and Sons; 1990."},{"key":"541_CR37","doi-asserted-by":"publisher","first-page":"53","DOI":"10.1016\/0377-0427(87)90125-7","volume":"20","author":"PJ Rousseeuw","year":"1987","unstructured":"Rousseeuw PJ: Silhouettes: a graphical aid to the interpretation and validation of cluster analysis. J Comput App Mat 1987, 20: 53\u201365. 10.1016\/0377-0427(87)90125-7","journal-title":"J Comput App Mat"},{"issue":"1","key":"541_CR38","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1016\/0167-4838(88)90050-7","volume":"954","author":"SA Woods","year":"1988","unstructured":"Woods SA, Schwartzbach SD, Guest JR: Two biochemically distinct classes of fumarase in Escherichia coli. Biochim Biophys Acta 1988, 954(1):14\u201326.","journal-title":"Biochim Biophys Acta"},{"key":"541_CR39","first-page":"164","volume":"5","author":"J Felsenstein","year":"1989","unstructured":"Felsenstein J: PHYLIP -- Phylogeny Inference Package (Version 3.2). Cladistics 1989, 5: 164\u2013166.","journal-title":"Cladistics"},{"key":"541_CR40","volume-title":"CBMS-NSF Regional Conference Series in Applied Mathematics","author":"B Efron","year":"1982","unstructured":"Efron B: The Jackknife, the Bootstrap, and Other Resampling Plans. In CBMS-NSF Regional Conference Series in Applied Mathematics. Philadelphia, Pennsylvania , Soc. Ind. Appl. Math.; 1982."},{"key":"541_CR41","doi-asserted-by":"publisher","first-page":"783","DOI":"10.2307\/2408678","volume":"39","author":"J Felsenstein","year":"1985","unstructured":"Felsenstein J: Confidence limits on phylogenies: An approach using the bootstrap. Evolution 1985, 39: 783\u2013791.","journal-title":"Evolution"},{"issue":"14","key":"541_CR42","doi-asserted-by":"publisher","first-page":"7085","DOI":"10.1073\/pnas.93.14.7085","volume":"93","author":"B Efron","year":"1996","unstructured":"Efron B, Halloran E, Holmes S: Bootstrap confidence levels for phylogenetic trees. Proc Natl Acad Sci U S A 1996, 93(14):7085\u20137090. 10.1073\/pnas.93.14.7085","journal-title":"Proc Natl Acad Sci U S A"},{"issue":"1","key":"541_CR43","doi-asserted-by":"publisher","first-page":"205","DOI":"10.1006\/jmbi.2000.4042","volume":"302","author":"C Notredame","year":"2000","unstructured":"Notredame C, Higgins DG, Heringa J: T-Coffee: A novel method for fast and accurate multiple sequence alignment. J Mol Biol 2000, 302(1):205\u2013217. 10.1006\/jmbi.2000.4042","journal-title":"J Mol Biol"},{"key":"541_CR44","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1007\/BF01908075","volume":"2","author":"L Hubert","year":"1985","unstructured":"Hubert L, Arabie P: Comparing partitions. J Classif 1985, 2: 193\u2013218. 10.1007\/BF01908075","journal-title":"J Classif"},{"key":"541_CR45","doi-asserted-by":"publisher","first-page":"149","DOI":"10.1016\/0097-8485(93)85006-X","volume":"17","author":"JC Wootton","year":"1993","unstructured":"Wootton JC, Federhen S: Statistics of local complexity in amino acid sequences and sequence databases. Comput Chem 1993, 17: 149\u2013163. 10.1016\/0097-8485(93)85006-X","journal-title":"Comput Chem"},{"key":"541_CR46","doi-asserted-by":"publisher","first-page":"191","DOI":"10.1016\/0097-8485(93)85010-A","volume":"17","author":"JM Claverie","year":"1993","unstructured":"Claverie JM, Slates DJ: Information enchancement methods for large scale sequence analysis. Comp Chem 1993, 17: 191\u2013201. 10.1016\/0097-8485(93)85010-A","journal-title":"Comp Chem"},{"issue":"5","key":"541_CR47","doi-asserted-by":"publisher","first-page":"1239","DOI":"10.1073\/pnas.84.5.1239","volume":"84","author":"MS Waterman","year":"1987","unstructured":"Waterman MS, Gordon L, Arratia R: Phase transitions in sequence matches and nucleic acid structure. Proc Natl Acad Sci U S A 1987, 84(5):1239\u20131243.","journal-title":"Proc Natl Acad Sci U S A"},{"key":"541_CR48","doi-asserted-by":"publisher","first-page":"460","DOI":"10.1016\/S0076-6879(96)66029-7","volume":"266","author":"SF Altschul","year":"1996","unstructured":"Altschul SF, Gish W: Local alignment statistics. Methods Enzymol 1996, 266: 460\u2013480.","journal-title":"Methods Enzymol"},{"issue":"17","key":"541_CR49","doi-asserted-by":"publisher","first-page":"3389","DOI":"10.1093\/nar\/25.17.3389","volume":"25","author":"SF Altschul","year":"1997","unstructured":"Altschul SF, Madden TL, Schaffer AA, Zhang J, Zhang Z, Miller W, Lipman DJ: Gapped BLAST and PSI-BLAST: a new generation of protein database search programs. Nucleic Acids Res 1997, 25(17):3389\u20133402. 10.1093\/nar\/25.17.3389","journal-title":"Nucleic Acids Res"},{"issue":"2","key":"541_CR50","doi-asserted-by":"publisher","first-page":"645","DOI":"10.1093\/nar\/13.2.645","volume":"13","author":"TF Smith","year":"1985","unstructured":"Smith TF, Waterman MS, Burks C: The statistical distribution of nucleic acid similarities. Nucleic Acids Res 1985, 13(2):645\u2013656.","journal-title":"Nucleic Acids Res"},{"issue":"1","key":"541_CR51","first-page":"67","volume":"4","author":"JF Collins","year":"1988","unstructured":"Collins JF, Coulson AF, Lyall A: The significance of protein sequence similarities. Comput Appl Biosci 1988, 4(1):67\u201371.","journal-title":"Comput Appl Biosci"},{"key":"541_CR52","doi-asserted-by":"publisher","first-page":"59","DOI":"10.1007\/BF02458620","volume":"54","author":"R Mott","year":"1992","unstructured":"Mott R: Maximum-likelihood estimation of the statistical distribution of Smith-Waterman local sequence similarity scores. Bull Math Biol 1992, 54: 59\u201375. 10.1016\/S0092-8240(05)80176-4","journal-title":"Bull Math Biol"},{"issue":"8","key":"541_CR53","doi-asserted-by":"publisher","first-page":"2444","DOI":"10.1073\/pnas.85.8.2444","volume":"85","author":"WR Pearson","year":"1988","unstructured":"Pearson WR, Lipman DJ: Improved tools for biological sequence comparison. Proc Natl Acad Sci U S A 1988, 85(8):2444\u20132448.","journal-title":"Proc Natl Acad Sci U S A"},{"issue":"7","key":"541_CR54","doi-asserted-by":"publisher","first-page":"267","DOI":"10.1016\/S0968-0004(97)01061-X","volume":"22","author":"B Vanhaesebroeck","year":"1997","unstructured":"Vanhaesebroeck B, Leevers SJ, Panayotou G, Waterfield MD: Phosphoinositide 3-kinases: a conserved family of signal transducers. Trends Biochem Sci 1997, 22(7):267\u2013272. 10.1016\/S0968-0004(97)01061-X","journal-title":"Trends Biochem Sci"},{"issue":"2","key":"541_CR55","doi-asserted-by":"publisher","first-page":"187","DOI":"10.1016\/S0304-4157(99)00005-2","volume":"1422","author":"L Buday","year":"1999","unstructured":"Buday L: Membrane-targeting of signalling molecules by SH2\/SH3 domain-containing adaptor proteins. Biochim Biophys Acta 1999, 1422(2):187\u2013204.","journal-title":"Biochim Biophys Acta"},{"key":"541_CR56","volume-title":"Programming Perl","author":"L Wall","year":"2002","unstructured":"Wall L, Christiansen T, Orwant J, Mui L: Programming Perl. O'Reilly & Associates, Inc., 101 Morris Street, Sebastopol, CA 95472; 2002."},{"key":"541_CR57","doi-asserted-by":"publisher","first-page":"227","DOI":"10.1016\/S0076-6879(96)66017-0","volume":"266","author":"WR Pearson","year":"1996","unstructured":"Pearson WR: Effective protein sequence comparison. Methods Enzymol 1996, 266: 227\u2013258.","journal-title":"Methods Enzymol"},{"issue":"1","key":"541_CR58","doi-asserted-by":"publisher","first-page":"195","DOI":"10.1016\/0022-2836(81)90087-5","volume":"147","author":"TF Smith","year":"1981","unstructured":"Smith TF, Waterman MS: Identification of common molecular subsequences. J Mol Biol 1981, 147(1):195\u2013197. 10.1016\/0022-2836(81)90087-5","journal-title":"J Mol Biol"},{"key":"541_CR59","doi-asserted-by":"crossref","first-page":"299","DOI":"10.1080\/10618600.1996.10474713","volume":"5","author":"R Ihaka","year":"1996","unstructured":"Ihaka R, Gentleman R: R: A language for data analysis and graphics. J Comp Graph Stat 1996, 5: 299\u2013314.","journal-title":"J Comp Graph Stat"},{"key":"541_CR60","doi-asserted-by":"crossref","DOI":"10.7312\/gumb92958","volume-title":"Statistics of extremes","author":"EJ Gumbel","year":"1958","unstructured":"Gumbel EJ: Statistics of extremes. New York , Columbia University Press; 1958."},{"issue":"1","key":"541_CR61","doi-asserted-by":"publisher","first-page":"71","DOI":"10.1006\/jmbi.1997.1525","volume":"276","author":"WR Pearson","year":"1998","unstructured":"Pearson WR: Empirical statistical estimates for sequence similarity searches. J Mol Biol 1998, 276(1):71\u201384. 10.1006\/jmbi.1997.1525","journal-title":"J Mol Biol"},{"key":"541_CR62","doi-asserted-by":"publisher","first-page":"200","DOI":"10.1214\/aoap\/1177005208","volume":"4","author":"R Arratia","year":"1994","unstructured":"Arratia R, Waterman MS: A phase transition for the score in matching random sequences allowing deletions. Ann App Prob 1994, 4: 200\u2013225.","journal-title":"Ann App Prob"},{"key":"541_CR63","unstructured":"Eddy SR: Maximum likelihood fitting of extreme value distributions.[ftp:\/\/ftp.genetics.wustl.edu\/pub\/eddy\/papers\/evd.pdf]"}],"container-title":["BMC Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/1471-2105-6-216.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,3]],"date-time":"2025-01-03T16:27:44Z","timestamp":1735921664000},"score":1,"resource":{"primary":{"URL":"https:\/\/bmcbioinformatics.biomedcentral.com\/articles\/10.1186\/1471-2105-6-216"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2005,8,31]]},"references-count":63,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2005,12]]}},"alternative-id":["541"],"URL":"https:\/\/doi.org\/10.1186\/1471-2105-6-216","relation":{},"ISSN":["1471-2105"],"issn-type":[{"value":"1471-2105","type":"electronic"}],"subject":[],"published":{"date-parts":[[2005,8,31]]},"assertion":[{"value":"2 February 2005","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 August 2005","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 August 2005","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"216"}}