{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,16]],"date-time":"2026-05-16T02:43:19Z","timestamp":1778899399395,"version":"3.51.4"},"reference-count":29,"publisher":"Oxford University Press (OUP)","issue":"13","license":[{"start":{"date-parts":[[2018,6,27]],"date-time":"2018-06-27T00:00:00Z","timestamp":1530057600000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc\/4.0\/"}],"funder":[{"DOI":"10.13039\/100000001","name":"NSF","doi-asserted-by":"publisher","award":["1553289"],"award-info":[{"award-number":["1553289"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000002","name":"NIH","doi-asserted-by":"publisher","award":["U01 GM115486"],"award-info":[{"award-number":["U01 GM115486"]}],"id":[{"id":"10.13039\/100000002","id-type":"DOI","asserted-by":"publisher"}]},{"name":"USDA-NIFA","award":["1015: 0228906"],"award-info":[{"award-number":["1015: 0228906"]}]},{"name":"TU Munich"},{"DOI":"10.13039\/501100005713","name":"TUM","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100005713","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Institute for Advanced Study Hans Fischer Fellowship"},{"DOI":"10.13039\/501100005713","name":"TUM","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100005713","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100005235","name":"IAS","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100005235","id-type":"DOI","asserted-by":"publisher"}]},{"name":"German Excellence Initiative"},{"DOI":"10.13039\/100011102","name":"EU Seventh Framework Programme","doi-asserted-by":"publisher","award":["291763"],"award-info":[{"award-number":["291763"]}],"id":[{"id":"10.13039\/100011102","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,7,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:sec>\n                  <jats:title>Motivation<\/jats:title>\n                  <jats:p>The rapid drop in sequencing costs has produced many more (predicted) protein sequences than can feasibly be functionally annotated with wet-lab experiments. Thus, many computational methods have been developed for this purpose. Most of these methods employ homology-based inference, approximated via sequence alignments, to transfer functional annotations between proteins. The increase in the number of available sequences, however, has drastically increased the search space, thus significantly slowing down alignment methods.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Results<\/jats:title>\n                  <jats:p>Here we describe homology-derived functional similarity of proteins (HFSP), a novel computational method that uses results of a high-speed alignment algorithm, MMseqs2, to infer functional similarity of proteins on the basis of their alignment length and sequence identity. We show that our method is accurate (85% precision) and fast (more than 40-fold speed increase over state-of-the-art). HFSP can help correct at least a 16% error in legacy curations, even for a resource of as high quality as Swiss-Prot. These findings suggest HFSP as an ideal resource for large-scale functional annotation efforts.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Supplementary information<\/jats:title>\n                  <jats:p>Supplementary data are available at Bioinformatics online.<\/jats:p>\n               <\/jats:sec>","DOI":"10.1093\/bioinformatics\/bty262","type":"journal-article","created":{"date-parts":[[2018,4,19]],"date-time":"2018-04-19T06:58:02Z","timestamp":1524121082000},"page":"i304-i312","source":"Crossref","is-referenced-by-count":47,"title":["HFSP: high speed homology-driven function annotation of proteins"],"prefix":"10.1093","volume":"34","author":[{"given":"Yannick","family":"Mahlich","sequence":"first","affiliation":[{"name":"Department of Biochemistry and Microbiology, Rutgers University, New Brunswick, NJ, USA"},{"name":"Computational Biology & Bioinformatics - i12\u00a0Informatics, Technical University of Munich (TUM), Munich, Germany"},{"name":"Institute for Advanced Study, Technical University of Munich (TUM), Munich, Germany"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Martin","family":"Steinegger","sequence":"additional","affiliation":[{"name":"Computational Biology & Bioinformatics - i12\u00a0Informatics, Technical University of Munich (TUM), Munich, Germany"},{"name":"Quantitative and Computational Biology Group, Max-Planck Institute for Biophysical Chemistry, G\u00f6ttingen, Germany"},{"name":"Department of Chemistry, Seoul National University, Seoul, Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Burkhard","family":"Rost","sequence":"additional","affiliation":[{"name":"Computational Biology & Bioinformatics - i12\u00a0Informatics, Technical University of Munich (TUM), Munich, Germany"},{"name":"Institute for Advanced Study, Technical University of Munich (TUM), Munich, Germany"},{"name":"TUM School of Life Sciences Weihenstephan (WZW), Technical University Munich (TUM), Freising, Germany"},{"name":"Department of Biochemistry and Molecular Biophysics, Columbia University, New York, NY, USA"},{"name":"New York Consortium on Membrane Protein Structure (NYCOMPS), New York, NY, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yana","family":"Bromberg","sequence":"additional","affiliation":[{"name":"Department of Biochemistry and Microbiology, Rutgers University, New Brunswick, NJ, USA"},{"name":"Institute for Advanced Study, Technical University of Munich (TUM), Munich, Germany"},{"name":"Department of Genetics, Human Genetics Institute, Rutgers University, Piscataway, NJ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2018,6,27]]},"reference":[{"key":"2023051604223320700_bty262-B1","doi-asserted-by":"crossref","first-page":"403","DOI":"10.1016\/S0022-2836(05)80360-2","article-title":"Basic local alignment search tool","volume":"215","author":"Altschul","year":"1990","journal-title":"J. Mol. Biol"},{"key":"2023051604223320700_bty262-B2","doi-asserted-by":"crossref","first-page":"3389","DOI":"10.1093\/nar\/25.17.3389","article-title":"Gapped BLAST and PSI-BLASsT: a new generation of protein database search programs","volume":"25","author":"Altschul","year":"1997","journal-title":"Nucleic Acids Res"},{"key":"2023051604223320700_bty262-B3","doi-asserted-by":"crossref","first-page":"25","DOI":"10.1038\/75556","article-title":"Gene ontology: tool for the unification of biology. The Gene Ontology Consortium","volume":"25","author":"Ashburner","year":"2000","journal-title":"Nat. Genet"},{"key":"2023051604223320700_bty262-B4","doi-asserted-by":"crossref","first-page":"304","DOI":"10.1093\/nar\/28.1.304","article-title":"The ENZYME database in 2000","volume":"28","author":"Bairoch","year":"2000","journal-title":"Nucleic Acids Res"},{"key":"2023051604223320700_bty262-B5","doi-asserted-by":"crossref","first-page":"5028","DOI":"10.1111\/j.1742-4658.2007.06025.x","article-title":"Triterpene synthases from the Okinawan mangrove tribe, Rhizophoraceae","volume":"274","author":"Basyuni","year":"2007","journal-title":"Febs. J"},{"key":"2023051604223320700_bty262-B6","doi-asserted-by":"crossref","first-page":"D36","DOI":"10.1093\/nar\/gks1195","article-title":"GenBank","volume":"41","author":"Benson","year":"2013","journal-title":"Nucleic Acids Res"},{"key":"2023051604223320700_bty262-B7","doi-asserted-by":"crossref","first-page":"899","DOI":"10.1107\/S0907444902003451","article-title":"The protein data bank","volume":"58","author":"Berman","year":"2002","journal-title":"Acta Crystallogr. D Biol. Crystallogr"},{"key":"2023051604223320700_bty262-B8","doi-asserted-by":"crossref","first-page":"2086","DOI":"10.1002\/prot.23029","article-title":"Analysis of protein function and its prediction from amino acid sequence","volume":"79","author":"Clark","year":"2011","journal-title":"Proteins"},{"key":"2023051604223320700_bty262-B9","doi-asserted-by":"crossref","first-page":"i283","DOI":"10.1093\/bioinformatics\/btt214","article-title":"Compressive genomics for protein databases","volume":"29","author":"Daniels","year":"2013","journal-title":"Bioinformatics"},{"key":"2023051604223320700_bty262-B10","doi-asserted-by":"crossref","first-page":"5863","DOI":"10.1093\/nar\/gkn579","article-title":"The whole alignment and nothing but the alignment: the problem of spurious alignment flanks","volume":"36","author":"Frith","year":"2008","journal-title":"Nucleic Acids Res"},{"key":"2023051604223320700_bty262-B11","doi-asserted-by":"crossref","first-page":"3150","DOI":"10.1093\/bioinformatics\/bts565","article-title":"CD-HIT: accelerated for clustering the next-generation sequencing data","volume":"28","author":"Fu","year":"2012","journal-title":"Bioinformatics"},{"key":"2023051604223320700_bty262-B12","doi-asserted-by":"crossref","first-page":"184","DOI":"10.1186\/s13059-016-1037-6","article-title":"An expanded evaluation of protein function prediction methods shows an improvement in accuracy","volume":"17","author":"Jiang","year":"2016","journal-title":"Genome Biol"},{"key":"2023051604223320700_bty262-B13","doi-asserted-by":"crossref","first-page":"30","DOI":"10.1186\/s13062-014-0030-9","article-title":"Genome-scale identification and characterization of moonlighting proteins","volume":"9","author":"Khan","year":"2014","journal-title":"Biol. Direct"},{"key":"2023051604223320700_bty262-B14","doi-asserted-by":"crossref","first-page":"1658","DOI":"10.1093\/bioinformatics\/btl158","article-title":"Cd-hit: a fast program for clustering and comparing large sets of protein or nucleotide sequences","volume":"22","author":"Li","year":"2006","journal-title":"Bioinformatics"},{"key":"2023051604223320700_bty262-B15","doi-asserted-by":"crossref","first-page":"207","DOI":"10.1186\/gb-2009-10-2-207","article-title":"Protein function annotation by homology-based inference","volume":"10","author":"Loewenstein","year":"2009","journal-title":"Genome Biol"},{"key":"2023051604223320700_bty262-B16","doi-asserted-by":"crossref","first-page":"308","DOI":"10.1093\/comjnl\/7.4.308","article-title":"A simplex method for function minimization","volume":"7","author":"Nelder","year":"1965","journal-title":"Comput. J"},{"key":"2023051604223320700_bty262-B17","doi-asserted-by":"crossref","first-page":"D380","DOI":"10.1093\/nar\/gkw952","article-title":"BRENDA in 2017: new perspectives and new tools in BRENDA","volume":"45","author":"Placzek","year":"2017","journal-title":"Nucleic Acids Res"},{"key":"2023051604223320700_bty262-B18","doi-asserted-by":"crossref","first-page":"221","DOI":"10.1038\/nmeth.2340","article-title":"A large-scale evaluation of computational protein function prediction","volume":"10","author":"Radivojac","year":"2013","journal-title":"Nat Methods"},{"key":"2023051604223320700_bty262-B19","doi-asserted-by":"crossref","first-page":"173","DOI":"10.1038\/nmeth.1818","article-title":"HHblits: lightning-fast iterative protein sequence searching by HMM-HMM alignment","volume":"9","author":"Remmert","year":"2012","journal-title":"Nat. Methods"},{"key":"2023051604223320700_bty262-B20","doi-asserted-by":"crossref","first-page":"85","DOI":"10.1093\/protein\/12.2.85","article-title":"Twilight zone of protein sequence alignments","volume":"12","author":"Rost","year":"1999","journal-title":"Protein Eng"},{"key":"2023051604223320700_bty262-B21","doi-asserted-by":"crossref","first-page":"595","DOI":"10.1016\/S0022-2836(02)00016-5","article-title":"Enzyme function less conserved than anticipated","volume":"318","author":"Rost","year":"2002","journal-title":"J. Mol. Biol"},{"key":"2023051604223320700_bty262-B22","doi-asserted-by":"crossref","first-page":"584","DOI":"10.1006\/jmbi.1993.1413","article-title":"Prediction of protein secondary structure at better than 70% accuracy","volume":"232","author":"Rost","year":"1993","journal-title":"J. Mol. Biol"},{"key":"2023051604223320700_bty262-B23","doi-asserted-by":"crossref","first-page":"56","DOI":"10.1002\/prot.340090107","article-title":"Database of homology-derived protein structures and the structural meaning of sequence alignment","volume":"9","author":"Sander","year":"1991","journal-title":"Proteins"},{"key":"2023051604223320700_bty262-B24","doi-asserted-by":"crossref","first-page":"e1000605","DOI":"10.1371\/journal.pcbi.1000605","article-title":"Annotation error in public databases: misannotation of molecular function in enzyme superfamilies","volume":"5","author":"Schnoes","year":"2009","journal-title":"PLoS Comput. Biol"},{"key":"2023051604223320700_bty262-B25","doi-asserted-by":"crossref","first-page":"1026","DOI":"10.1038\/nbt.3988","article-title":"MMseqs2 enables sensitive protein sequence searching for the analysis of massive data sets","volume":"35","author":"Steinegger","year":"2017","journal-title":"Nat. Biotechnol"},{"key":"2023051604223320700_bty262-B26","doi-asserted-by":"crossref","first-page":"D158","DOI":"10.1093\/nar\/gkw1099","article-title":"UniProt: the universal protein knowledgebase","volume":"45","author":"The UniProt, C","year":"2017","journal-title":"Nucleic Acids Res"},{"key":"2023051604223320700_bty262-B27","doi-asserted-by":"crossref","first-page":"e67863.","DOI":"10.1371\/journal.pone.0067863","article-title":"The role of balanced training and testing data sets for binary classifiers in bioinformatics","volume":"8","author":"Wei","year":"2013","journal-title":"PLoS One"},{"key":"2023051604223320700_bty262-B28","doi-asserted-by":"crossref","first-page":"e1004472","DOI":"10.1371\/journal.pcbi.1004472","article-title":"Functional basis of microorganism classification","volume":"11","author":"Zhu","year":"2015","journal-title":"PLoS Comput. Biol"},{"key":"2023051604223320700_bty262-B29","doi-asserted-by":"crossref","first-page":"D535","DOI":"10.1093\/nar\/gkx1060","article-title":"fusionDB: assessing microbial diversity and environmental preferences via functional similarity networks","volume":"46","author":"Zhu","year":"2018","journal-title":"Nucleic Acids Res"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/34\/13\/i304\/50315619\/bioinformatics_34_13_i304.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/34\/13\/i304\/50315619\/bioinformatics_34_13_i304.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,5,16]],"date-time":"2023-05-16T04:24:18Z","timestamp":1684211058000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/34\/13\/i304\/5045799"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,6,27]]},"references-count":29,"journal-issue":{"issue":"13","published-print":{"date-parts":[[2018,7,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/bty262","relation":{},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2018,7,1]]},"published":{"date-parts":[[2018,6,27]]}}}