{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,23]],"date-time":"2026-04-23T05:07:31Z","timestamp":1776920851150,"version":"3.51.2"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"S4","content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["BMC Syst Biol"],"published-print":{"date-parts":[[2016,12]]},"DOI":"10.1186\/s12918-016-0352-6","type":"journal-article","created":{"date-parts":[[2016,12,23]],"date-time":"2016-12-23T06:37:42Z","timestamp":1482475062000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Identifying the missing proteins in human proteome by biological language model"],"prefix":"10.1186","volume":"10","author":[{"given":"Qiwen","family":"Dong","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kai","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2016,12,23]]},"reference":[{"issue":"5507","key":"352_CR1","doi-asserted-by":"crossref","first-page":"1304","DOI":"10.1126\/science.1058040","volume":"291","author":"JC Venter","year":"2001","unstructured":"Venter JC, Adams MD, Myers EW, Li PW, Mural RJ, Sutton GG, Smith HO, Yandell M, Evans CA, Holt RA, et al. The sequence of the human genome. Science. 2001;291(5507):1304\u201351.","journal-title":"Science"},{"issue":"7","key":"352_CR2","doi-asserted-by":"crossref","first-page":"M111 009993","DOI":"10.1074\/mcp.M111.009993","volume":"10","author":"P Legrain","year":"2011","unstructured":"Legrain P, Aebersold R, Archakov A, Bairoch A, Bala K, Beretta L, Bergeron J, Borchers CH, Corthals GL, Costello CE, et al. The human proteome project: current state and future direction. Mol Cell Proteomics. 2011;10(7):M111 009993.","journal-title":"Mol Cell Proteomics"},{"issue":"3","key":"352_CR3","doi-asserted-by":"crossref","first-page":"221","DOI":"10.1038\/nbt.2152","volume":"30","author":"YK Paik","year":"2012","unstructured":"Paik YK, Jeong SK, Omenn GS, Uhlen M, Hanash S, Cho SY, Lee HJ, Na K, Choi EY, Yan F, et al. The Chromosome-Centric Human Proteome Project for cataloging proteins encoded in the genome. Nat Biotechnol. 2012;30(3):221\u20133.","journal-title":"Nat Biotechnol"},{"issue":"1","key":"352_CR4","doi-asserted-by":"crossref","first-page":"23","DOI":"10.1021\/pr301151m","volume":"12","author":"R Aebersold","year":"2013","unstructured":"Aebersold R, Bader GD, Edwards AM, van Eyk JE, Kussmann M, Qin J, Omenn GS. The biology\/disease-driven human proteome project (B\/D-HPP): enabling protein research for the life sciences community. J Proteome Res. 2013;12(1):23\u20137.","journal-title":"J Proteome Res"},{"issue":"1","key":"352_CR5","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1021\/pr301183a","volume":"12","author":"G Marko-Varga","year":"2013","unstructured":"Marko-Varga G, Omenn GS, Paik YK, Hancock WS. A first step toward completion of a genome-wide characterization of the human proteome. J Proteome Res. 2013;12(1):1\u20135.","journal-title":"J Proteome Res"},{"issue":"Database issue","key":"352_CR6","doi-asserted-by":"crossref","first-page":"D749","DOI":"10.1093\/nar\/gkt1196","volume":"42","author":"P Flicek","year":"2014","unstructured":"Flicek P, Amode MR, Barrell D, Beal K, Billis K, Brent S, Carvalho-Silva D, Clapham P, Coates G, Fitzgerald S, et al. Ensembl 2014. Nucleic Acids Res. 2014;42(Database issue):D749\u2013755.","journal-title":"Nucleic Acids Res"},{"issue":"1","key":"352_CR7","doi-asserted-by":"crossref","first-page":"162","DOI":"10.1021\/pr301012j","volume":"12","author":"T Farrah","year":"2013","unstructured":"Farrah T, Deutsch EW, Hoopmann MR, Hallows JL, Sun Z, Huang CY, Moritz RL. The state of the human proteome in 2012 as viewed through PeptideAtlas. J Proteome Res. 2013;12(1):162\u201371.","journal-title":"J Proteome Res"},{"issue":"6","key":"352_CR8","doi-asserted-by":"crossref","first-page":"1234","DOI":"10.1021\/pr049882h","volume":"3","author":"R Craig","year":"2004","unstructured":"Craig R, Cortens JP, Beavis RC. Open source system for analyzing, validating, and storing protein identification data. J Proteome Res. 2004;3(6):1234\u201342.","journal-title":"J Proteome Res"},{"issue":"12","key":"352_CR9","doi-asserted-by":"crossref","first-page":"1248","DOI":"10.1038\/nbt1210-1248","volume":"28","author":"M Uhlen","year":"2010","unstructured":"Uhlen M, Oksvold P, Fagerberg L, Lundberg E, Jonasson K, Forsberg M, Zwahlen M, Kampf C, Wester K, Hober S, et al. Towards a knowledge-based Human Protein Atlas. Nat Biotechnol. 2010;28(12):1248\u201350.","journal-title":"Nat Biotechnol"},{"issue":"Database issue","key":"352_CR10","doi-asserted-by":"crossref","first-page":"D76","DOI":"10.1093\/nar\/gkr1179","volume":"40","author":"L Lane","year":"2012","unstructured":"Lane L, Argoud-Puy G, Britan A, Cusin I, Duek PD, Evalet O, Gateau A, Gaudet P, Gleizes A, Masselot A, et al. neXtProt: a knowledge platform for human proteins. Nucleic Acids Res. 2012;40(Database issue):D76\u201383.","journal-title":"Nucleic Acids Res"},{"issue":"1","key":"352_CR11","doi-asserted-by":"crossref","first-page":"15","DOI":"10.1021\/pr401144x","volume":"13","author":"L Lane","year":"2014","unstructured":"Lane L, Bairoch A, Beavis RC, Deutsch EW, Gaudet P, Lundberg E, Omenn GS. Metrics for the Human Proteome Project 2013-2014 and strategies for finding missing proteins. J Proteome Res. 2014;13(1):15\u201320.","journal-title":"J Proteome Res"},{"issue":"1","key":"352_CR12","doi-asserted-by":"crossref","first-page":"25","DOI":"10.1006\/jtbi.1996.0239","volume":"184","author":"AA Tsonis","year":"1997","unstructured":"Tsonis AA, Elsner JB, Tsonis PA. Is DNA a language? J Theor Biol. 1997;184(1):25\u20139.","journal-title":"J Theor Biol"},{"key":"352_CR13","doi-asserted-by":"crossref","first-page":"323","DOI":"10.1186\/1471-2105-10-323","volume":"10","author":"W Dyrka","year":"2009","unstructured":"Dyrka W, Nebel JC. A stochastic context free grammar based framework for analysis of protein sequences. BMC Bioinformatics. 2009;10:323.","journal-title":"BMC Bioinformatics"},{"key":"352_CR14","doi-asserted-by":"crossref","first-page":"25","DOI":"10.1007\/978-3-540-32263-4_2","volume":"3345","author":"M Ganapathiraju","year":"2005","unstructured":"Ganapathiraju M, Balakrishnan N, Reddy R, Klein-Seetharaman J. Computational Biology and Language. Ambient Intell Sci Discov LNAI. 2005;3345:25\u201347.","journal-title":"Ambient Intell Sci Discov LNAI"},{"issue":"4","key":"352_CR15","first-page":"333","volume":"13","author":"DB Searls","year":"1997","unstructured":"Searls DB. Linguistic approaches to biological sequences. Comput Appl Biosci. 1997;13(4):333\u201344.","journal-title":"Comput Appl Biosci"},{"key":"352_CR16","doi-asserted-by":"crossref","unstructured":"Ganapathiraju M, Weisser D, Rosenfeld R, Carbonell J, Reddy R, Klein-Seetharaman J: Comparative n-gram analysis of whole-genome protein sequences. In: Proceedings of the second international conference on Human Language Technology Research. San Diego: Morgan Kaufmann Publishers Inc; 2002. pp. 76\u201381.","DOI":"10.3115\/1289189.1289259"},{"issue":"8","key":"352_CR17","doi-asserted-by":"crossref","first-page":"4516","DOI":"10.1073\/pnas.0737502100","volume":"100","author":"L Coin","year":"2003","unstructured":"Coin L, Bateman A, Durbin R. Enhanced protein domain discovery by using language modeling techniques from speech recognition. Proc Natl Acad Sci. 2003;100(8):4516\u201320.","journal-title":"Proc Natl Acad Sci"},{"issue":"17","key":"352_CR18","doi-asserted-by":"crossref","first-page":"3901","DOI":"10.1093\/nar\/gkf464","volume":"30","author":"I Rigoutsos","year":"2002","unstructured":"Rigoutsos I, Huynh T, Floratos A, Parida L, Platt D. Dictionary-driven protein annotation. Nucleic Acids Res. 2002;30(17):3901\u201316.","journal-title":"Nucleic Acids Res"},{"issue":"3","key":"352_CR19","doi-asserted-by":"crossref","first-page":"285","DOI":"10.1093\/bioinformatics\/bti801","volume":"22","author":"Q-W Dong","year":"2006","unstructured":"Dong Q-W, Wang X-L, Lin L. Application of latent semantic analysis to protein remote homology detection. Bioinformatics. 2006;22(3):285\u201390.","journal-title":"Bioinformatics"},{"key":"352_CR20","doi-asserted-by":"crossref","first-page":"510","DOI":"10.1186\/1471-2105-9-510","volume":"9","author":"B Liu","year":"2008","unstructured":"Liu B, Wang X, Lin L, Dong Q. A discriminative method for protein remote homology detection and fold recognition combining Top-n-grams and latent semantic analysis. BMC Bioinformatics. 2008;9:510.","journal-title":"BMC Bioinformatics"},{"key":"352_CR21","first-page":"S3","volume":"Suppl 2","author":"B Liu","year":"2014","unstructured":"Liu B, Xu J, Zou Q, Xu R, Wang X, Chen Q. Using distances between Top-n-gram and residue pairs for protein remote homology detection. BMC Bioinformatics. 2014;Suppl 2:S3.","journal-title":"BMC Bioinformatics"},{"issue":"4","key":"352_CR22","doi-asserted-by":"crossref","first-page":"472","DOI":"10.1093\/bioinformatics\/btt709","volume":"30","author":"B Liu","year":"2014","unstructured":"Liu B, Zhang D, Xu R, Xu J, Wang X, Chen Q, Dong Q, Chou KC. Combining evolutionary information extracted from frequency profiles with sequence-based kernels for protein remote homology detection. Bioinformatics. 2014;30(4):472\u20139.","journal-title":"Bioinformatics"},{"issue":"1","key":"352_CR23","doi-asserted-by":"crossref","first-page":"8","DOI":"10.1002\/minf.201400025","volume":"34","author":"B Liu","year":"2015","unstructured":"Liu B, Xu J, Fan S, Xu R, Zhou J, Wang X. PseDNA-Pro: DNA-Binding Protein Identification by Combining Chou\u2019s PseAAC and Physicochemical Distance Transformation. Mol Inform. 2015;34(1):8\u201317.","journal-title":"Mol Inform"},{"issue":"9","key":"352_CR24","doi-asserted-by":"crossref","first-page":"e106691","DOI":"10.1371\/journal.pone.0106691","volume":"9","author":"B Liu","year":"2014","unstructured":"Liu B, Xu J, Lan X, Xu R, Zhou J, Wang X, Chou KC. iDNA-Prot|dis: identifying DNA-binding proteins by incorporating amino acid distance-pairs and reduced alphabet profile into the general pseudo amino acid composition. PLoS ONE. 2014;9(9):e106691.","journal-title":"PLoS ONE"},{"issue":"D1","key":"352_CR25","doi-asserted-by":"crossref","first-page":"D1079","DOI":"10.1093\/nar\/gku1071","volume":"43","author":"KA Gray","year":"2015","unstructured":"Gray KA, Yates B, Seal RL, Wright MW, Bruford EA. Genenames. org: the HGNC resources in. Nucleic Acids Res. 2015;43(D1):D1079\u201385.","journal-title":"Nucleic Acids Res"},{"issue":"7502","key":"352_CR26","doi-asserted-by":"crossref","first-page":"575","DOI":"10.1038\/nature13302","volume":"509","author":"M-S Kim","year":"2014","unstructured":"Kim M-S, Pinto SM, Getnet D, Nirujogi RS, Manda SS, Chaerkady R, Madugundu AK, Kelkar DS, Isserlin R, Jain S. A draft map of the human proteome. Nature. 2014;509(7502):575\u201381.","journal-title":"Nature"},{"key":"352_CR27","doi-asserted-by":"crossref","unstructured":"Consortium U. UniProt: a hub for protein information. Nucleic Acids Res. 2015;43(Database issue):D204\u2013212.","DOI":"10.1093\/nar\/gku989"},{"issue":"23","key":"352_CR28","doi-asserted-by":"crossref","first-page":"3150","DOI":"10.1093\/bioinformatics\/bts565","volume":"28","author":"L Fu","year":"2012","unstructured":"Fu L, Niu B, Zhu Z, Wu S, Li W. CD-HIT: accelerated for clustering the next-generation sequencing data. Bioinformatics. 2012;28(23):3150\u20132.","journal-title":"Bioinformatics"},{"issue":"4","key":"352_CR29","doi-asserted-by":"crossref","first-page":"725","DOI":"10.1038\/nprot.2010.5","volume":"5","author":"A Roy","year":"2010","unstructured":"Roy A, Kucukural A, Zhang Y. I-TASSER: a unified platform for automated protein structure and function prediction. Nat Protoc. 2010;5(4):725\u201338.","journal-title":"Nat Protoc"},{"issue":"Web Server issu","key":"352_CR30","doi-asserted-by":"crossref","first-page":"W471","DOI":"10.1093\/nar\/gks372","volume":"40","author":"A Roy","year":"2012","unstructured":"Roy A, Yang J, Zhang Y. COFACTOR: an accurate comparative algorithm for structure-based protein function annotation. Nucleic Acids Res. 2012;40(Web Server issue):W471\u2013477.","journal-title":"Nucleic Acids Res"},{"issue":"2","key":"352_CR31","doi-asserted-by":"crossref","first-page":"269","DOI":"10.1016\/j.ab.2009.07.046","volume":"394","author":"HB Shen","year":"2009","unstructured":"Shen HB, Chou KC. A top-down approach to enhance the power of predicting human protein subcellular localization: Hum-mPLoc 2.0. Anal Biochem. 2009;394(2):269\u201374.","journal-title":"Anal Biochem"},{"issue":"8","key":"352_CR32","doi-asserted-by":"crossref","first-page":"1307","DOI":"10.1093\/bioinformatics\/btu820","volume":"31","author":"B Liu","year":"2015","unstructured":"Liu B, Liu F, Fang L, Wang X, Chou KC. repDNA: a Python package to generate various modes of feature vectors for DNA sequences by incorporating user-defined physicochemical properties and sequence-order effects. Bioinformatics. 2015;31(8):1307\u20139.","journal-title":"Bioinformatics"},{"key":"352_CR33","doi-asserted-by":"crossref","unstructured":"Liu B, Liu F, Wang X, Chen J, Fang L, Chou KC. Pse-in-One: a web server for generating various modes of pseudo components of DNA, RNA, and protein sequences. Nucleic Acids Res. 2015;43(W1):W65\u201371.","DOI":"10.1093\/nar\/gkv458"},{"key":"352_CR34","doi-asserted-by":"crossref","unstructured":"Liu B, Liu F, Fang L, Wang X, Chou KC. repRNA: a web server for generating various feature vectors of RNA sequences. Mol Genet Genomics. 2016;291(1):473\u201381.","DOI":"10.1007\/s00438-015-1078-7"},{"key":"352_CR35","doi-asserted-by":"crossref","unstructured":"Hristea FT. Statistical Natural Language Processing. In: International Encyclopedia of Statistical Science. Heidelberg: Springer; 2011. pp. 1452\u20131453","DOI":"10.1007\/978-3-642-04898-2_82"},{"issue":"9","key":"352_CR36","doi-asserted-by":"crossref","first-page":"3750","DOI":"10.1021\/acs.jproteome.5b00516","volume":"14","author":"Q Dong","year":"2015","unstructured":"Dong Q, Menon R, Omenn GS, Zhang Y. Structural Bioinformatics Inspection of neXtProt PE5 Proteins in the Human Proteome. J Proteome Res. 2015;14(9):3750\u201361.","journal-title":"J Proteome Res"},{"issue":"D1","key":"352_CR37","doi-asserted-by":"crossref","first-page":"D304","DOI":"10.1093\/nar\/gkt1240","volume":"42","author":"NK Fox","year":"2014","unstructured":"Fox NK, Brenner SE, Chandonia J-M. SCOPe: Structural Classification of Proteins\u2014extended, integrating SCOP and ASTRAL data and classification of new structures. Nucleic Acids Res. 2014;42(D1):D304\u20139.","journal-title":"Nucleic Acids Res"},{"issue":"4","key":"352_CR38","first-page":"536","volume":"247","author":"AG Murzin","year":"1995","unstructured":"Murzin AG, Brenner SE, Hubbard T, Chothia C. SCOP: a structural classification of proteins database for the investigation of sequences and structures. J Mol Biol. 1995;247(4):536\u201340.","journal-title":"J Mol Biol"},{"issue":"Database issue","key":"352_CR39","doi-asserted-by":"crossref","first-page":"D189","DOI":"10.1093\/nar\/gkh034","volume":"32","author":"JM Chandonia","year":"2004","unstructured":"Chandonia JM, Hon G, Walker NS, Lo Conte L, Koehl P, Levitt M, Brenner SE. The ASTRAL Compendium in 2004. Nucleic Acids Res. 2004;32(Database issue):D189\u2013192.","journal-title":"Nucleic Acids Res"},{"issue":"7","key":"352_CR40","doi-asserted-by":"crossref","first-page":"2302","DOI":"10.1093\/nar\/gki524","volume":"33","author":"Y Zhang","year":"2005","unstructured":"Zhang Y, Skolnick J. TM-align: a protein structure alignment algorithm based on the TM-score. Nucleic Acids Res. 2005;33(7):2302\u20139.","journal-title":"Nucleic Acids Res"},{"key":"352_CR41","doi-asserted-by":"crossref","unstructured":"Gray KA, Yates B, Seal RL, Wright MW, Bruford EA. Genenames.org: the HGNC resources in 2015. Nucleic Acids Res. 2015;43(Database issue):D1079\u201385.","DOI":"10.1093\/nar\/gku1071"},{"issue":"Database issue","key":"352_CR42","doi-asserted-by":"crossref","first-page":"D655","DOI":"10.1093\/nar\/gkj040","volume":"34","author":"F Desiere","year":"2006","unstructured":"Desiere F, Deutsch EW, King NL, Nesvizhskii AI, Mallick P, Eng J, Chen S, Eddes J, Loevenich SN, Aebersold R. The PeptideAtlas project. Nucleic Acids Res. 2006;34(Database issue):D655\u2013658.","journal-title":"Nucleic Acids Res"},{"issue":"7502","key":"352_CR43","doi-asserted-by":"crossref","first-page":"582","DOI":"10.1038\/nature13319","volume":"509","author":"M Wilhelm","year":"2014","unstructured":"Wilhelm M, Schlegl J, Hahne H, Moghaddas Gholami A, Lieberenz M, Savitski MM, Ziegler E, Butzmann L, Gessulat S, Marx H, et al. Mass-spectrometry-based draft of the human proteome. Nature. 2014;509(7502):582\u20137.","journal-title":"Nature"},{"issue":"Database issue","key":"352_CR44","doi-asserted-by":"crossref","first-page":"D756","DOI":"10.1093\/nar\/gkt1114","volume":"42","author":"KD Pruitt","year":"2014","unstructured":"Pruitt KD, Brown GR, Hiatt SM, Thibaud-Nissen F, Astashyn A, Ermolaeva O, Farrell CM, Hart J, Landrum MJ, McGarvey KM, et al. RefSeq: an update on mammalian reference sequences. Nucleic Acids Res. 2014;42(Database issue):D756\u2013763.","journal-title":"Nucleic Acids Res"}],"container-title":["BMC Systems Biology"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s12918-016-0352-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,9,16]],"date-time":"2019-09-16T17:41:44Z","timestamp":1568655704000},"score":1,"resource":{"primary":{"URL":"http:\/\/bmcsystbiol.biomedcentral.com\/articles\/10.1186\/s12918-016-0352-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,12]]},"references-count":44,"journal-issue":{"issue":"S4","published-print":{"date-parts":[[2016,12]]}},"alternative-id":["352"],"URL":"https:\/\/doi.org\/10.1186\/s12918-016-0352-6","relation":{},"ISSN":["1752-0509"],"issn-type":[{"value":"1752-0509","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016,12]]},"article-number":"113"}}