{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,25]],"date-time":"2026-08-25T22:49:06Z","timestamp":1787698146584,"version":"build-2784847793"},"reference-count":36,"publisher":"Oxford University Press (OUP)","issue":"5","license":[{"start":{"date-parts":[[2018,8,25]],"date-time":"2018-08-25T00:00:00Z","timestamp":1535155200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/academic.oup.com\/journals\/pages\/open_access\/funder_policies\/chorus\/standard_publication_model"}],"funder":[{"DOI":"10.13039\/100011038","name":"Office of the Director of National Intelligence","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100011038","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100011039","name":"Intelligence Advanced Research Projects Activity","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100011039","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000183","name":"Army Research Office","doi-asserted-by":"publisher","award":["W911NF-17-2-0105"],"award-info":[{"award-number":["W911NF-17-2-0105"]}],"id":[{"id":"10.13039\/100000183","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["DBI1262189"],"award-info":[{"award-number":["DBI1262189"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["DMS1614777"],"award-info":[{"award-number":["DMS1614777"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000002","name":"National Institutes of Health","doi-asserted-by":"publisher","award":["R01GM123055"],"award-info":[{"award-number":["R01GM123055"]}],"id":[{"id":"10.13039\/100000002","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019,3,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:sec>\n                  <jats:title>Motivation<\/jats:title>\n                  <jats:p>Function annotation of proteins is fundamental in contemporary biology across fields including genomics, molecular biology, biochemistry, systems biology and bioinformatics. Function prediction is indispensable in providing clues for interpreting omics-scale data as well as in assisting biologists to build hypotheses for designing experiments. As sequencing genomes is now routine due to the rapid advancement of sequencing technologies, computational protein function prediction methods have become increasingly important. A conventional method of annotating a protein sequence is to transfer functions from top hits of a homology search; however, this approach has substantial short comings including a low coverage in genome annotation.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Results<\/jats:title>\n                  <jats:p>Here we have developed Phylo-PFP, a new sequence-based protein function prediction method, which mines functional information from a broad range of similar sequences, including those with a low sequence similarity identified by a PSI-BLAST search. To evaluate functional similarity between identified sequences and the query protein more accurately, Phylo-PFP reranks retrieved sequences by considering their phylogenetic distance. Compared to the Phylo-PFP\u2019s predecessor, PFP, which was among the top ranked methods in the second round of the Critical Assessment of Functional Annotation (CAFA2), Phylo-PFP demonstrated substantial improvement in prediction accuracy. Phylo-PFP was further shown to outperform prediction programs to date that were ranked top in CAFA2.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Availability and implementation<\/jats:title>\n                  <jats:p>Phylo-PFP web server is available for at http:\/\/kiharalab.org\/phylo_pfp.php.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Supplementary information<\/jats:title>\n                  <jats:p>Supplementary data are available at Bioinformatics online.<\/jats:p>\n               <\/jats:sec>","DOI":"10.1093\/bioinformatics\/bty704","type":"journal-article","created":{"date-parts":[[2018,8,23]],"date-time":"2018-08-23T19:31:23Z","timestamp":1535052683000},"page":"753-759","source":"Crossref","is-referenced-by-count":40,"title":["Phylo-PFP: improved automated protein function prediction using phylogenetic distance of distantly related sequences"],"prefix":"10.1093","volume":"35","author":[{"given":"Aashish","family":"Jain","sequence":"first","affiliation":[{"name":"Department of Computer Science, Purdue University, West Lafayette, IN, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4091-6614","authenticated-orcid":false,"given":"Daisuke","family":"Kihara","sequence":"additional","affiliation":[{"name":"Department of Computer Science, Purdue University, West Lafayette, IN, USA"},{"name":"Department of Biological Sciences, Purdue University, West Lafayette, IN, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2018,8,25]]},"reference":[{"key":"2023020108345750200_bty704-B1","doi-asserted-by":"crossref","first-page":"bas019","DOI":"10.1093\/database\/bas019","article-title":"The PRINTS database: a fine-grained protein sequence annotation and analysis resource\u2013its status in 2012","volume":"2012","author":"Attwood","year":"2012","journal-title":"Database (Oxford)"},{"key":"2023020108345750200_bty704-B2","doi-asserted-by":"crossref","first-page":"e1003537","DOI":"10.1371\/journal.pcbi.1003537","article-title":"BEAST 2: a software platform for Bayesian evolutionary analysis","volume":"10","author":"Bouckaert","year":"2014","journal-title":"PLoS Comput. Biol"},{"key":"2023020108345750200_bty704-B3","doi-asserted-by":"crossref","first-page":"23","DOI":"10.1007\/978-1-4939-3167-5_2","article-title":"UniProtKB\/Swiss-Prot, the manually annotated section of the UniProt KnowledgeBase: how to use the entry view","volume":"1374","author":"Boutet","year":"2016","journal-title":"Methods Mol. Biol"},{"key":"2023020108345750200_bty704-B4","doi-asserted-by":"crossref","first-page":"D212","DOI":"10.1093\/nar\/gki034","article-title":"The ProDom database of protein domain families: more emphasis on 3D","volume":"33","author":"Bru","year":"2005","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B5","doi-asserted-by":"crossref","first-page":"2090","DOI":"10.1093\/molbev\/msl080","article-title":"Exploring the relationship between sequence similarity and accurate phylogenetic trees","volume":"23","author":"Cantarel","year":"2006","journal-title":"Mol. Biol. Evol"},{"key":"2023020108345750200_bty704-B6","doi-asserted-by":"crossref","first-page":"S2.","DOI":"10.1186\/1471-2105-14-S3-S2","article-title":"In-depth performance evaluation of PFP and ESG sequence-based function prediction methods in CAFA 2011 experiment","volume":"14","author":"Chitale","year":"2013","journal-title":"BMC Bioinformatics"},{"key":"2023020108345750200_bty704-B7","doi-asserted-by":"crossref","first-page":"D1049","DOI":"10.1093\/nar\/gku1179","article-title":"Gene Ontology Consortium: going forward","volume":"43","author":"Consortium","year":"2015","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B8","doi-asserted-by":"crossref","first-page":"1792","DOI":"10.1093\/nar\/gkh340","article-title":"MUSCLE: multiple sequence alignment with high accuracy and high throughput","volume":"32","author":"Edgar","year":"2004","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B9","doi-asserted-by":"crossref","first-page":"163","DOI":"10.1101\/gr.8.3.163","article-title":"Phylogenomics: improving functional predictions for uncharacterized genes by evolutionary analysis","volume":"8","author":"Eisen","year":"1998","journal-title":"Genome Res"},{"key":"2023020108345750200_bty704-B10","doi-asserted-by":"crossref","first-page":"D649","DOI":"10.1093\/nar\/gkx1132","article-title":"The reactome pathway knowledgebase","volume":"46","author":"Fabregat","year":"2018","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B11","doi-asserted-by":"crossref","first-page":"368","DOI":"10.1007\/BF01734359","article-title":"Evolutionary trees from DNA sequences: a maximum likelihood approach","volume":"17","author":"Felsenstein","year":"1981","journal-title":"J. Mol. Evol"},{"key":"2023020108345750200_bty704-B12","doi-asserted-by":"crossref","first-page":"D190","DOI":"10.1093\/nar\/gkw1107","article-title":"InterPro in 2017-beyond protein family and domain annotations","volume":"45","author":"Finn","year":"2017","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B13","doi-asserted-by":"crossref","first-page":"D279","DOI":"10.1093\/nar\/gkv1344","article-title":"The Pfam protein families database: towards a more sustainable future","volume":"44","author":"Finn","year":"2016","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B14","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1016\/j.ymeth.2015.08.009","article-title":"GoFDR: a sequence alignment based method for predicting protein functions","volume":"93","author":"Gong","year":"2016","journal-title":"Methods"},{"key":"2023020108345750200_bty704-B15","doi-asserted-by":"crossref","first-page":"D387","DOI":"10.1093\/nar\/gks1234","article-title":"TIGRFAMs and genome properties in 2013","volume":"41","author":"Haft","year":"2013","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B16","doi-asserted-by":"crossref","first-page":"566","DOI":"10.1002\/prot.22172","article-title":"PFP: automated prediction of gene ontology functional annotations with confidence scores using protein sequence data","volume":"74","author":"Hawkins","year":"2009","journal-title":"Proteins"},{"key":"2023020108345750200_bty704-B17","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1142\/S0219720007002503","article-title":"Function prediction of uncharacterized proteins","volume":"5","author":"Hawkins","year":"2007","journal-title":"J. Bioinform. Comput. Biol"},{"key":"2023020108345750200_bty704-B18","doi-asserted-by":"crossref","first-page":"1550","DOI":"10.1110\/ps.062153506","article-title":"Enhanced automated function prediction using distantly related sequences and contextual association by PFP","volume":"15","author":"Hawkins","year":"2006","journal-title":"Protein Sci"},{"key":"2023020108345750200_bty704-B19","doi-asserted-by":"crossref","first-page":"184","DOI":"10.1186\/s13059-016-1037-6","article-title":"An expanded evaluation of protein function prediction methods shows an improvement in accuracy","volume":"17","author":"Jiang","year":"2016","journal-title":"Genome Biol"},{"key":"2023020108345750200_bty704-B20","doi-asserted-by":"crossref","first-page":"D493","DOI":"10.1093\/nar\/gkx922","article-title":"20 years of the SMART protein domain annotation resource","volume":"46","author":"Letunic","year":"2018","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B21","doi-asserted-by":"crossref","first-page":"165","DOI":"10.1002\/prot.21651","article-title":"Assessment of predictions submitted for the CASP7 function prediction category","volume":"69","author":"Lopez","year":"2007","journal-title":"Proteins"},{"key":"2023020108345750200_bty704-B22","doi-asserted-by":"crossref","first-page":"287","DOI":"10.1146\/annurev-anchem-062012-092628","article-title":"Next-generation sequencing platforms","volume":"6","author":"Mardis","year":"2013","journal-title":"Annu. Rev. Anal. Chem. (Palo Alto Calif)"},{"key":"2023020108345750200_bty704-B23","doi-asserted-by":"crossref","first-page":"i444","DOI":"10.1093\/bioinformatics\/bts398","article-title":"Protein domain recurrence and order can enhance prediction of protein functions","volume":"28","author":"Messih","year":"2012","journal-title":"Bioinformatics"},{"key":"2023020108345750200_bty704-B24","doi-asserted-by":"crossref","first-page":"D761","DOI":"10.1093\/nar\/gkr1023","article-title":"UniPathway: a resource for the exploration and annotation of metabolic pathways","volume":"40","author":"Morgat","year":"2012","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B25","doi-asserted-by":"crossref","first-page":"117693430600200","DOI":"10.1177\/117693430600200033","article-title":"PIRSF family classification system for protein functional and evolutionary analysis","volume":"2","author":"Nikolskaya","year":"2006","journal-title":"Evol. Bioinform. Online"},{"key":"2023020108345750200_bty704-B26","doi-asserted-by":"crossref","first-page":"D1064","DOI":"10.1093\/nar\/gku1002","article-title":"HAMAP in 2015: updates to the protein family classification and annotation system","volume":"43","author":"Pedruzzi","year":"2015","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B27","doi-asserted-by":"crossref","first-page":"221","DOI":"10.1038\/nmeth.2340","article-title":"A large-scale evaluation of computational protein function prediction","volume":"10","author":"Radivojac","year":"2013","journal-title":"Nat. Methods"},{"key":"2023020108345750200_bty704-B28","doi-asserted-by":"crossref","first-page":"173","DOI":"10.1038\/nmeth.1818","article-title":"HHblits: lightning-fast iterative protein sequence searching by HMM-HMM alignment","volume":"9","author":"Remmert","year":"2011","journal-title":"Nat. Methods"},{"key":"2023020108345750200_bty704-B29","doi-asserted-by":"crossref","first-page":"539","DOI":"10.1093\/sysbio\/sys029","article-title":"MrBayes 3.2: efficient Bayesian phylogenetic inference and model choice across a large model space","volume":"61","author":"Ronquist","year":"2012","journal-title":"Syst. Biol"},{"key":"2023020108345750200_bty704-B30","doi-asserted-by":"crossref","first-page":"W141","DOI":"10.1093\/nar\/gkv461","article-title":"SIFTER search: a web server for accurate phylogeny-based protein function prediction","volume":"43","author":"Sahraeian","year":"2015","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B31","doi-asserted-by":"crossref","first-page":"D344","DOI":"10.1093\/nar\/gks1067","article-title":"New and continuing developments at PROSITE","volume":"41","author":"Sigrist","year":"2013","journal-title":"Nucleic Acids Res"},{"key":"2023020108345750200_bty704-B32","first-page":"451","article-title":"Heterogeneous molecular processes among the causes of how sequence similarity scores can fail to recapitulate phylogeny","volume":"18","author":"Smith","year":"2017","journal-title":"Brief. Bioinform"},{"key":"2023020108345750200_bty704-B33","doi-asserted-by":"crossref","first-page":"1026","DOI":"10.1038\/nbt.3988","article-title":"MMseqs2 enables sensitive protein sequence searching for the analysis of massive data sets","volume":"35","author":"Steinegger","year":"2017","journal-title":"Nat. Biotechnol"},{"key":"2023020108345750200_bty704-B34","doi-asserted-by":"crossref","first-page":"926","DOI":"10.1093\/bioinformatics\/btu739","article-title":"UniRef clusters: a comprehensive and scalable alternative for improving sequence similarity searches","volume":"31","author":"Suzek","year":"2015","journal-title":"Bioinformatics"},{"key":"2023020108345750200_bty704-B35","doi-asserted-by":"crossref","first-page":"798","DOI":"10.1093\/bioinformatics\/btn037","article-title":"ConFunc \u2013 Functional Annotation in the Twilight Zone","volume":"24","author":"Wass","year":"2008","journal-title":"Bioinformatics"},{"key":"2023020108345750200_bty704-B36","doi-asserted-by":"crossref","first-page":"1586","DOI":"10.1093\/molbev\/msm088","article-title":"PAML 4: phylogenetic analysis by maximum likelihood","volume":"24","author":"Yang","year":"2007","journal-title":"Mol. Biol. Evol"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/35\/5\/753\/48965979\/bioinformatics_35_5_753.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/35\/5\/753\/48965979\/bioinformatics_35_5_753.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,2,1]],"date-time":"2023-02-01T19:40:25Z","timestamp":1675280425000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/35\/5\/753\/5079331"}},"subtitle":[],"editor":[{"given":"Russell","family":"Schwartz","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"editor"}]}],"short-title":[],"issued":{"date-parts":[[2018,8,25]]},"references-count":36,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2019,3,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/bty704","relation":{},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2019,3,1]]},"published":{"date-parts":[[2018,8,25]]}}}