{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,26]],"date-time":"2025-07-26T09:15:02Z","timestamp":1753521302945,"version":"3.37.3"},"reference-count":48,"publisher":"Springer Science and Business Media LLC","issue":"20","license":[{"start":{"date-parts":[[2018,4,24]],"date-time":"2018-04-24T00:00:00Z","timestamp":1524528000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100004872","name":"State Oceanic Administration","doi-asserted-by":"publisher","award":["201305026"],"award-info":[{"award-number":["201305026"]}],"id":[{"id":"10.13039\/501100004872","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100010264","name":"shanghai maritime university","doi-asserted-by":"crossref","award":["20130469"],"award-info":[{"award-number":["20130469"]}],"id":[{"id":"10.13039\/501100010264","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Key Lab of Broadband Wireless Communication and Sensor Network Technology (Nanjing University of Posts and Telecommunications),Ministry of Education"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Soft Comput"],"published-print":{"date-parts":[[2018,10]]},"DOI":"10.1007\/s00500-018-3181-2","type":"journal-article","created":{"date-parts":[[2018,4,24]],"date-time":"2018-04-24T08:49:30Z","timestamp":1524559770000},"page":"6705-6717","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":11,"title":["Building neural network language model with POS-based negative sampling and stochastic conjugate gradient descent"],"prefix":"10.1007","volume":"22","author":[{"given":"Jin","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haoliang","family":"Ren","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Minghao","family":"Gu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Geumran","family":"Youn","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jeong-Uk","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,4,24]]},"reference":[{"issue":"7","key":"3181_CR1","doi-asserted-by":"publisher","first-page":"507","DOI":"10.1016\/B978-0-08-051584-7.50046-2","volume":"37","author":"LR Bahl","year":"1990","unstructured":"Bahl LR, Brown PF, Souza PVD, Mercer RL (1990) A tree-based statistical language model for natural language speech recognition. Read Speech Recogn 37(7):507\u2013514","journal-title":"Read Speech Recogn"},{"key":"3181_CR2","first-page":"1137","volume":"3","author":"Y Bengio","year":"2003","unstructured":"Bengio Y, Ducharme R, Vincent P, Jauvin P, Jaz K (2003) A neural probabilistic language model. J Mach Learn Res (JMLR) 3:1137\u20131155","journal-title":"J Mach Learn Res (JMLR)"},{"key":"3181_CR3","doi-asserted-by":"crossref","unstructured":"Bottou L (2010) Large-scale machine learning with stochastic gradient descent. In: Proceedings of COMPSTAT2010","DOI":"10.1007\/978-3-7908-2604-3_16"},{"issue":"4","key":"3181_CR4","first-page":"467","volume":"18","author":"PF Brown","year":"1992","unstructured":"Brown PF, Desouza PV, Mercer RL, Pietra VJD, Lai JC (1992) Class-based n-gram models of natural language. Comput Linguist 18(4):467\u2013479","journal-title":"Comput Linguist"},{"key":"3181_CR5","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1016\/j.neunet.2015.02.012","volume":"66","author":"HCC Carneiro","year":"2015","unstructured":"Carneiro HCC, Franca FMG, Lima PMV (2015) Multilingual part-of-speech tagging with weightless neural networks. Neural Netw 66:11\u201321","journal-title":"Neural Netw"},{"key":"3181_CR6","unstructured":"Defazio A, Bach F, Lacoste-Julien S (2014) SAGA: a fast incremental gradient method with support for non-strongly convex composite objectives. In: Proceedings of the international conference on neural information processing systems. MIT Press, pp 1646\u20131654"},{"key":"3181_CR7","doi-asserted-by":"crossref","unstructured":"Feyzmahdavian HR, Aytekin A, Johansson M (2014) A delayed proximal gradient method with linear convergence rate. In: Proceedings of IEEE international workshop on machine learning for signal processing. IEEE, pp 1\u20136","DOI":"10.1109\/MLSP.2014.6958872"},{"issue":"1","key":"3181_CR8","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1186\/s13673-017-0092-7","volume":"7","author":"AG Finogeev","year":"2017","unstructured":"Finogeev AG, Alexey G, Parygin Danila S, Finogeev Anton A (2017) The convergence computing model for big sensor data mining and knowledge discovery. Human Centric Comput Inf Sci 7(1):11\u201327","journal-title":"Human Centric Comput Inf Sci"},{"issue":"3","key":"3181_CR9","first-page":"453","volume":"16","author":"ZJ Fu","year":"2015","unstructured":"Fu ZJ, Shu JG, Wang J, Liu YL, Lee SY (2015) Privacy-preserving smart similarity search based on simhash over encrypted data in cloud computing. J Internet Technol 16(3):453\u2013460","journal-title":"J Internet Technol"},{"key":"3181_CR10","unstructured":"Goldberg Y, Levy O (2014) word2vec Explained: deriving Mikolov et al.\u2019s negative-sampling word-embedding method. Eprint Arxiv: 1-5"},{"key":"3181_CR11","unstructured":"Hinton GE (1986) Learning distributed representations of concepts. In: Proceedings of the 8th Annual Conference of the Cognitive Science Society, pp 1\u201312"},{"issue":"1","key":"3181_CR12","doi-asserted-by":"publisher","first-page":"85","DOI":"10.1162\/COLI_a_00167","volume":"40","author":"F Huang","year":"2016","unstructured":"Huang F, Ahuja A, Downey D, Yang Y, Guo Y (2016) Learning representations for weakly supervised natural language processing tasks. Comput Linguist 40(1):85\u2013120","journal-title":"Comput Linguist"},{"key":"3181_CR13","volume-title":"Statistical method for speech recognition","author":"F Jelinek","year":"1997","unstructured":"Jelinek F (1997) Statistical method for speech recognition. A Bradford Book, Cambridge"},{"key":"3181_CR14","unstructured":"Jiang M, Zhu X, Yuan B (1999) Smoothing algorithm of the task adaptation Chinses N-gram model. Tsinghua Univ (Sci&Tech)"},{"issue":"08","key":"3181_CR15","first-page":"2670","volume":"2","author":"D Jurafsky","year":"2015","unstructured":"Jurafsky D, Martin JH (2015) Speech and language processing: an introduction to natural language processing, computational linguistics and speech recognition. Int J Comput Sci Eng 2(08):2670\u20132676","journal-title":"Int J Comput Sci Eng"},{"key":"3181_CR16","doi-asserted-by":"publisher","first-page":"213","DOI":"10.1016\/j.specom.2013.07.004","volume":"56","author":"A Karpov","year":"2014","unstructured":"Karpov A, Markov K, Kipyatkova I, Vazhenina D, Ronzhin A (2014) Large vocabulary Russian speech recognition using syntactico-statistical language modeling. Speech Commun 56:213\u2013228","journal-title":"Speech Commun"},{"key":"3181_CR17","doi-asserted-by":"crossref","unstructured":"Kim Y, Jernite Y, Sontag D, Rush AM (2016) Character-aware neural language models. In: Proceedings of the thirtieth AAAI conference on artificial intelligence (AAAI-16), pp 2741\u20132749","DOI":"10.1609\/aaai.v30i1.10362"},{"key":"3181_CR18","unstructured":"Kiros R, Salakhutdinov R, Zemel R (2014) Multimodal neural language model. In: Proceedings of the 31st international conference on machine learning, pp 595\u2013604"},{"key":"3181_CR19","doi-asserted-by":"crossref","unstructured":"Kombrink S, Mikolov T, Karafi\u00e1t M, Burget L (2011) Recurrent neural network based language modeling in meeting recognition. In: Interspeech, Conference of the international speech communication association Florence, Italy, August, pp 2877\u20132880","DOI":"10.21437\/Interspeech.2011-720"},{"issue":"2","key":"3181_CR20","first-page":"282","volume":"3","author":"JD Lafferty","year":"2001","unstructured":"Lafferty JD, Mccallum A, Pereira FCN (2001) Conditional random fields: probabilistic models for segmenting and labeling sequence data. Eighteenth Int Conf Mach Learn 3(2):282\u2013289","journal-title":"Eighteenth Int Conf Mach Learn"},{"key":"3181_CR21","doi-asserted-by":"crossref","unstructured":"Lebret R, Grangier D, Auli M (2016) Neural text generation from structured data with application to the biography domain. In: Proceedings of the 2016 conference on empirical methods in natural language processing, pp 1203\u20131213","DOI":"10.18653\/v1\/D16-1128"},{"issue":"1","key":"3181_CR22","doi-asserted-by":"publisher","first-page":"378","DOI":"10.1016\/j.patcog.2009.06.003","volume":"43","author":"Q Li","year":"2010","unstructured":"Li Q, Chen YP (2010) Personalized text snippet extraction using statistical language models. Pattern Recogn 43(1):378\u2013386","journal-title":"Pattern Recogn"},{"key":"3181_CR23","doi-asserted-by":"publisher","first-page":"661","DOI":"10.1145\/2623330.2623612","volume":"2014","author":"M Li","year":"2014","unstructured":"Li M, Zhang T, Chen Y, Smola AJ (2014) Efficient mini-batch training for stochastic optimization. Acm Sigkdd Int Conf Knowl Discov Data Min 2014:661\u2013670","journal-title":"Acm Sigkdd Int Conf Knowl Discov Data Min"},{"key":"3181_CR24","unstructured":"Mikolov T, Kombrink S, Deoras A, Burget L, Cernocky JH (2011) RNNLM\u2014Recurrent Neural Network Language Modeling Toolkit. ASRU 2011"},{"key":"3181_CR25","doi-asserted-by":"publisher","first-page":"27","DOI":"10.1016\/j.neucom.2017.11.044","volume":"281","author":"Y Ming","year":"2018","unstructured":"Ming Y, Zhao Y, Wu C, Li K, Yin J (2018) Distributed and asynchronous stochastic gradient descent with variance reduction. Neurocomputing 281:27\u201336","journal-title":"Neurocomputing"},{"key":"3181_CR26","doi-asserted-by":"crossref","unstructured":"Miyamoto Y, Cho K (2016) Gated word-character recurrent language model. In: Proceedings of the 2016 conference on empirical methods in natural language processing, pp 1992\u20131997","DOI":"10.18653\/v1\/D16-1209"},{"issue":"1","key":"3181_CR27","doi-asserted-by":"publisher","first-page":"61","DOI":"10.1016\/j.csl.2014.09.005","volume":"30","author":"WD Mulder","year":"2015","unstructured":"Mulder WD, Bethard S, Moens M (2015) A survey on the application of recurrent neural networks to statistical language modeling. Comput Speech Lang 30(1):61\u201398","journal-title":"Comput Speech Lang"},{"key":"3181_CR28","doi-asserted-by":"publisher","first-page":"474","DOI":"10.1016\/j.procs.2017.08.065","volume":"112","author":"R Nagata","year":"2017","unstructured":"Nagata R, Takamura H, Neubig G (2017) Adaptive spelling error correction models for learner english. Procedia Comput Sci 112:474\u2013483","journal-title":"Procedia Comput Sci"},{"key":"3181_CR29","doi-asserted-by":"publisher","first-page":"109","DOI":"10.1016\/j.procs.2015.12.055","volume":"73","author":"M Nejja","year":"2015","unstructured":"Nejja M, Yousfi A (2015) The context in automatic spell correction. Procedia Comput Sci 73:109\u2013114","journal-title":"Procedia Comput Sci"},{"key":"3181_CR30","unstructured":"Nguyen AT, Nguyen TN (2015) Graph-based statistical language model for code. In: 2015 IEEE\/ACM 37th IEEE international conference on software engineering, pp 858\u2013868"},{"key":"3181_CR31","doi-asserted-by":"crossref","unstructured":"Novais EMD, Tadeu TD, Paraboni I (2010) Improved text generation using N-gram statistics. Springer, Berlin, Heidelberg 6433(1):316\u2013325","DOI":"10.1007\/978-3-642-16952-6_32"},{"key":"3181_CR32","doi-asserted-by":"publisher","first-page":"30","DOI":"10.1016\/j.csl.2017.06.005","volume":"47","author":"Jos\u00e9 Novoa","year":"2018","unstructured":"Novoa J, Fredes J, Poblete V, Yoma NB (2017) Uncertainty weighting and propagation in DNN-HMM-based speech recognition. Comput Speech Lang 47:30\u201346","journal-title":"Computer Speech & Language"},{"issue":"3","key":"3181_CR33","doi-asserted-by":"publisher","first-page":"459","DOI":"10.3745\/JIPS.2011.7.3.459","volume":"7","author":"KM Park","year":"2011","unstructured":"Park KM, Cho HC, Rim HC (2011) Utilizing various natural language processing techniques for biomedical interaction extraction. J Inf Process Syst 7(3):459\u2013472","journal-title":"J Inf Process Syst"},{"key":"3181_CR34","doi-asserted-by":"publisher","first-page":"201","DOI":"10.1016\/j.csl.2016.12.003","volume":"45","author":"A Peris","year":"2017","unstructured":"Peris A, Domingo M, Casacuberta F (2017) Interactive neural machine translation. Comput Speech Lang 45:201\u2013220","journal-title":"Comput Speech Lang"},{"key":"3181_CR35","unstructured":"Peter J, Klakow D (1999) Compact maximum entropy language models. In: Proceedings of the IEEE workshop on automatic speech recognition & understanding"},{"key":"3181_CR36","doi-asserted-by":"publisher","first-page":"351","DOI":"10.1016\/j.procs.2017.10.061","volume":"116","author":"MR Phangtriastu","year":"2017","unstructured":"Phangtriastu MR, Harefa J, Tanoto DF (2017) Comparison between neural network and support vector machine in optical character recognition. Procedia Comput Sci 116:351\u2013357","journal-title":"Procedia Comput Sci"},{"issue":"1","key":"3181_CR37","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1016\/S0893-6080(98)00116-6","volume":"12","author":"N Qian","year":"1999","unstructured":"Qian N (1999) On the momentum term in gradient descent learning algorithms. Neural Netw Off J Int Neural Netw Soc 12(1):145\u2013151","journal-title":"Neural Netw Off J Int Neural Netw Soc"},{"key":"3181_CR38","doi-asserted-by":"publisher","DOI":"10.21236\/ADA458711","volume-title":"Adaptive statistical language modeling: a maximum entropy approach","author":"R Rosenfeld","year":"1994","unstructured":"Rosenfeld R, Carbonell J, Rudnicky A, Roukos S, Corporation I (1994) Adaptive statistical language modeling: a maximum entropy approach. Carnegie Mellon University, Pittsburgh"},{"key":"3181_CR39","doi-asserted-by":"publisher","first-page":"2402","DOI":"10.1109\/TIFS.2017.2705620","volume":"12","author":"J Shen","year":"2017","unstructured":"Shen J, Shen J, Chen XF, Huang XY, Susilo Willy (2017) An efficient public auditing protocol with novel dynamic structure for cloud data. IEEE Trans Inf Forensics Secur 12:2402\u20132415. https:\/\/doi.org\/10.1109\/TIFS.2017.2705620","journal-title":"IEEE Trans Inf Forensics Secur"},{"issue":"1","key":"3181_CR40","doi-asserted-by":"publisher","first-page":"2","DOI":"10.1186\/2192-1962-1-2","volume":"1","author":"RY Shtykh","year":"2011","unstructured":"Shtykh RY, Roman Y, Jin Q (2011) A human-centric integrated approach to web information search and sharing. Human Centric Comput Inf Sci 1(1):2\u201338","journal-title":"Human Centric Comput Inf Sci"},{"issue":"1\u20133","key":"3181_CR41","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1007\/s10994-005-0928-7","volume":"60","author":"S Wang","year":"2005","unstructured":"Wang S, Schuurmans D, Peng F, Zhao Y (2005) Combining statistical language models via the latent maximum entropy principle. Mach Learn 60(1\u20133):229\u2013250","journal-title":"Mach Learn"},{"key":"3181_CR42","doi-asserted-by":"publisher","first-page":"219","DOI":"10.1016\/j.neunet.2017.06.003","volume":"93","author":"L Wang","year":"2017","unstructured":"Wang L, Yang Y, Min R, Chakradhar S (2017) Accelerating deep neural network training with inconsistent stochastic gradient descent. Neural Netw 93:219\u2013229","journal-title":"Neural Netw"},{"issue":"2","key":"3181_CR43","doi-asserted-by":"crossref","first-page":"1341","DOI":"10.1016\/j.amc.2006.05.150","volume":"183","author":"Z Wei","year":"2006","unstructured":"Wei Z, Yao S, Liu L (2006) The convergence properties of some new conjugate gradient methods. Appl Math Comput 183(2):1341\u20131350","journal-title":"Appl Math Comput"},{"issue":"2","key":"3181_CR44","doi-asserted-by":"crossref","first-page":"1335","DOI":"10.1145\/2783258.2783323","volume":"1","author":"EP Xing","year":"2015","unstructured":"Xing EP, Ho Q, Dai W, Kim JK, Wei J (2015) Petuum: a new platform for distributed machine learning on big data. Acm Sigkdd Int Conf Knowl Discov Data Min 1(2):1335\u20131344","journal-title":"Acm Sigkdd Int Conf Knowl Discov Data Min"},{"key":"3181_CR45","doi-asserted-by":"crossref","unstructured":"Xu W, Rudnicky AI (2000) Can artificial neural networks learn language models? In: Sixth international conference on spoken language processing, ICSLP 2000\/INTERSPEECH 2000, pp 202\u2013205","DOI":"10.21437\/ICSLP.2000-50"},{"issue":"4","key":"3181_CR46","doi-asserted-by":"publisher","first-page":"1642","DOI":"10.1016\/j.patcog.2013.10.020","volume":"47","author":"F Zamora-Martinez","year":"2014","unstructured":"Zamora-Martinez F, Frinken V, Espa\u00f1a-Boquera S, Castro-Bleda MJ, Fischer A, Bunke H (2014) Neural network language models for off-line handwriting recognition. Pattern Recogn 47(4):1642\u20131652","journal-title":"Pattern Recogn"},{"key":"3181_CR47","doi-asserted-by":"publisher","first-page":"420","DOI":"10.1016\/j.neucom.2017.04.044","volume":"260","author":"E Zamora","year":"2017","unstructured":"Zamora E, Sossa H (2017) Dendrite morphological neurons trained by stochastic gradient descent. Neurocomputing 260:420\u2013431","journal-title":"Neurocomputing"},{"issue":"23","key":"3181_CR48","first-page":"2595","volume":"23","author":"M Zinkevich","year":"2011","unstructured":"Zinkevich M, Weimer M, Smola AJ, Li L (2011) Parallelized stochastic gradient descent. Adv Neural Inf Process Syst 23(23):2595\u20132603","journal-title":"Adv Neural Inf Process Syst"}],"container-title":["Soft Computing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s00500-018-3181-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00500-018-3181-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00500-018-3181-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,20]],"date-time":"2022-08-20T20:33:17Z","timestamp":1661027597000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s00500-018-3181-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,4,24]]},"references-count":48,"journal-issue":{"issue":"20","published-print":{"date-parts":[[2018,10]]}},"alternative-id":["3181"],"URL":"https:\/\/doi.org\/10.1007\/s00500-018-3181-2","relation":{},"ISSN":["1432-7643","1433-7479"],"issn-type":[{"type":"print","value":"1432-7643"},{"type":"electronic","value":"1433-7479"}],"subject":[],"published":{"date-parts":[[2018,4,24]]},"assertion":[{"value":"24 April 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Compliance with ethical standards"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"This article does not contain any studies with human participants performed by any of the authors.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical approval"}}]}}