{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T15:30:37Z","timestamp":1784215837931,"version":"3.55.0"},"reference-count":112,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2022]]},"DOI":"10.1109\/access.2022.3149798","type":"journal-article","created":{"date-parts":[[2022,2,7]],"date-time":"2022-02-07T20:56:38Z","timestamp":1644267398000},"page":"17078-17097","source":"Crossref","is-referenced-by-count":108,"title":["Framework for Deep Learning-Based Language Models Using Multi-Task Learning in Natural Language Understanding: A Systematic Literature Review and Future Directions"],"prefix":"10.1109","volume":"10","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5158-9180","authenticated-orcid":false,"given":"Rahul Manohar","family":"Samant","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6647-9347","authenticated-orcid":false,"given":"Mrinal R.","family":"Bachute","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3882-7030","authenticated-orcid":false,"given":"Shilpa","family":"Gite","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2653-3780","authenticated-orcid":false,"given":"Ketan","family":"Kotecha","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"Astounding Artificial Intelligence Statistics for 2020","year":"2021"},{"key":"ref2","volume-title":"Chatbots: The Past, Present, and Future","year":"2018"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1002\/(SICI)1097-4571(199009)41:6<391::AID-ASI1>3.0.CO;2-9"},{"key":"ref4","first-page":"1137","article-title":"A neural probabilistic language model","volume":"3","author":"Bengio","year":"1985","journal-title":"J. Mach. Learn. Res."},{"key":"ref5","first-page":"3111","article-title":"Distributed representations of words and phrases and their compositionality","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Mikolov"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N18-1202"},{"key":"ref7","first-page":"5998","article-title":"Attention is all you need","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Vaswani"},{"key":"ref8","volume-title":"Improving Language Understanding by Generative Pre-Training","author":"Radford","year":"2021"},{"key":"ref9","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv:1810.04805"},{"key":"ref10","article-title":"Language models are few-shot learners","author":"Brown","year":"2020","journal-title":"arXiv:2005.14165"},{"key":"ref11","article-title":"GShard: Scaling giant models with conditional computation and automatic sharding","author":"Lepikhin","year":"2020","journal-title":"arXiv:2006.16668"},{"key":"ref12","volume-title":"Announcing Megatron or Training Trillion Parameter Models Rivavailability","year":"2021"},{"key":"ref13","article-title":"The next decade in AI: Four steps towards robust artificial intelligence","author":"Marcus","year":"2020","journal-title":"arXiv:2002.06177"},{"key":"ref14","article-title":"Adversarial NLI: A new benchmark for natural language understanding","author":"Nie","year":"2019","journal-title":"arXiv:1910.14599"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3430937"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1093\/nsr\/nwx105"},{"key":"ref17","first-page":"5999","article-title":"Attention is all you need","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Vaswani"},{"key":"ref18","first-page":"1","article-title":"Guidelines for performing systematic literature reviews in SE","volume":"3","author":"Kitchenham","year":"2007","journal-title":"Guidel. Perform. Syst. Lit. Rev."},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1264"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/S14-2001"},{"key":"ref21","article-title":"Efficient estimation of word representations in vector space","author":"Mikolov","year":"2013","journal-title":"arXiv:1301.3781"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1162"},{"key":"ref23","article-title":"FastText.Zip: Compressing text classification models","author":"Joulin","year":"2016","journal-title":"arXiv:1612.03651"},{"key":"ref24","first-page":"90","article-title":"Baselines and bigrams: Simple, good sentiment and topic classification","volume-title":"Proc. 50th Annu. Meeting Assoc. Comput. Linguistics","volume":"2","author":"Wang"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.5555\/3044805.3045025"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/p15-1150"},{"key":"ref27","first-page":"1604","article-title":"Long short-term memory over recursive structures","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhu"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D15-1280"},{"key":"ref29","article-title":"Recurrent neural network for text classification with multi-task learning","author":"Liu","year":"2016","journal-title":"arXiv:1605.05101"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/5.726791"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/P14-1062"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1181"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/3077136.3080834"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/IRI.2016.61"},{"key":"ref35","article-title":"Very deep convolutional networks for text classification","author":"Conneau","year":"2016","journal-title":"arXiv:1606.01781"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-30487-4_16"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2019.07.052"},{"key":"ref39","article-title":"A sensitivity analysis of (and practitioners\u2019 guide to) convolutional neural networks for sentence classification","author":"Zhang","year":"2015","journal-title":"arXiv:1510.03820"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-21735-7_6"},{"key":"ref41","first-page":"3856","article-title":"Dynamic routing between capsules","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Sabour"},{"key":"ref42","first-page":"1","article-title":"Matrix capsules with em routing","volume-title":"Proc. 6th Int. Conf. Learn. Represent.","author":"Sabour"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2019.10.033"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2022.05.028"},{"key":"ref45","article-title":"Neural machine translation by jointly learning to align and translate","author":"Bahdanau","year":"2014","journal-title":"arXiv:1409.0473"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N16-1174"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1024"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11941"},{"key":"ref49","article-title":"Learning natural language inference using bidirectional LSTM model and inner-attention","author":"Liu","year":"2016","journal-title":"arXiv:1605.09090"},{"key":"ref50","first-page":"404","article-title":"TextRank: Bringing order into text","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process.","author":"Mihalcea"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.2978386"},{"key":"ref52","article-title":"Semi-supervised classification with graph convolutional networks","author":"Kipf","year":"2016","journal-title":"arXiv:1609.02907"},{"key":"ref53","article-title":"Graph attention networks","author":"Cucurull","year":"2017","journal-title":"arXiv:1710.10903"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33017370"},{"key":"ref55","article-title":"A C-LSTM neural network for text classification","author":"Zhou","year":"2015","journal-title":"arXiv:1511.08630"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N16-1177"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2017.7966144"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/d15-1167"},{"key":"ref59","article-title":"Efficient character-level document classification by combining convolution and recurrent layers","author":"Xiao","year":"2016","journal-title":"arXiv:1602.00367"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2019.8852406"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/p18-1157"},{"key":"ref62","first-page":"1","article-title":"Training very deep networks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Srivastava"},{"issue":"8","key":"ref63","first-page":"9","article-title":"Language models are unsupervised multi-task learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI Blog"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1007\/s11431-020-1647-3"},{"key":"ref65","article-title":"RoBERTa: A robustly optimized BERT pretraining approach","author":"Liu","year":"2019","journal-title":"arXiv:1907.11692"},{"key":"ref66","article-title":"ALBERT: A lite BERT for self-supervised learning of language representations","author":"Lan","year":"2019","journal-title":"arXiv:1909.11942"},{"key":"ref67","article-title":"DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter","author":"Sanh","year":"2019","journal-title":"arXiv:1910.01108"},{"key":"ref68","article-title":"SpanBERT: Improving pre-training by representing and predicting spans","author":"Joshi","year":"2019","journal-title":"arXiv:1907.10529"},{"key":"ref69","article-title":"ERNIE: Enhanced representation through knowledge integration","author":"Sun","year":"2019","journal-title":"arXiv:1904.09223"},{"key":"ref70","first-page":"5754","article-title":"XLNet: Generalized autoregressive pre-training for language understanding","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Yang"},{"key":"ref71","first-page":"13042","article-title":"Unified language model pre-training for natural language understanding and generation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Dong"},{"key":"ref72","article-title":"The natural language decathlon: Multitask learning as question answering","author":"McCann","year":"2018","journal-title":"arXiv:1806.08730"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.3390\/app11073095"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1609\/aimag.v38i4.2745"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2018.12.008"},{"key":"ref76","first-page":"5824","article-title":"Gradient surgery for multi-task learning","volume-title":"Proc. 34th Conf. Neural Inf. Process. Syst.","author":"Yu"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W18-5446"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W18-5446"},{"key":"ref79","first-page":"1","article-title":"SuperGLUE: A stickier benchmark for general-purpose language understanding systems","volume-title":"Proc. 33rd Conf. Neural Inf. Process. Syst.","author":"Wang"},{"key":"ref80","article-title":"Reading and acting while blindfolded: The need for semantics in text game agents","author":"Narasimhan","year":"2021","journal-title":"arXiv:2103.13552"},{"key":"ref81","first-page":"1074","article-title":"Hierarchical regularization cascade for joint learning","volume-title":"Proc. 30th Int. Conf. Mach. Learn.","volume":"2","author":"Zweig"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.2983593"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P17-1168"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1031"},{"key":"ref85","first-page":"2358","article-title":"A through examination of the CNN\/daily mail reading comprehension task","volume-title":"Proc. 54th Annu. Meeting ACL","author":"Chen"},{"key":"ref86","first-page":"55","article-title":"Towards better UD parsing","volume-title":"Proc. CoNLL","author":"Che"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.4018\/IJCINI.20210401.oa4"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3077350"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.3390\/mti3030052"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.3390\/jpm10030062"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W17-5522"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1016\/j.procs.2020.09.095"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1088\/1742-6596\/1487\/1\/012014"},{"key":"ref94","first-page":"1","article-title":"Enriching language models with semantics","volume-title":"Proc. 24th Eur. Conf. Artif. Intell.","author":"Mayer"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.3390\/make1020037"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/BigData47090.2019.9005635"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.31470\/2309-1797-2019-25-1-431-443"},{"key":"ref98","first-page":"117","article-title":"EA NLU: Practical language understanding for cognitive modelling","volume-title":"Proc. 22nd Int. Florida Artif. Intell. Res. Soc. Conf.","volume":"22","author":"Tomal"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46493-0_37"},{"issue":"11","key":"ref100","article-title":"Predicting garden path sentences based on natural language understanding system","volume":"3","author":"Du","year":"2012","journal-title":"Int. J. Adv. Comput. Sci. Appl."},{"key":"ref101","article-title":"Dynamic integration of background knowledge in neural NLU systems","author":"Weissenborn","year":"2017","journal-title":"arXiv:1706.02596"},{"key":"ref102","first-page":"167","article-title":"All roads lead to UD: Converting stanford and penn parses to english universal dependencies with multi-layer annotations","volume-title":"Proc. Joint Workshop Linguistic Annotation, Multiword Expressions, Construct. Workshop","author":"Peng"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/SLT48900.2021.9383576"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.3015996"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2018\/559"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pone.0249030"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.3390\/app10030762"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.3001684"},{"key":"ref109","first-page":"7148","article-title":"Auxiliary task reweighting for minimum-data learning","volume-title":"Proc. 34th Conf. Neural Inf. Process. Syst.","author":"Shi"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D17-1195"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1153"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4615-5529-2_5"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/9668973\/09706456.pdf?arnumber=9706456","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,17]],"date-time":"2024-01-17T22:51:19Z","timestamp":1705531879000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9706456\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022]]},"references-count":112,"URL":"https:\/\/doi.org\/10.1109\/access.2022.3149798","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022]]}}}