{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T19:58:29Z","timestamp":1777406309994,"version":"3.51.4"},"reference-count":54,"publisher":"Springer Science and Business Media LLC","issue":"21","license":[{"start":{"date-parts":[[2021,5,12]],"date-time":"2021-05-12T00:00:00Z","timestamp":1620777600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,5,12]],"date-time":"2021-05-12T00:00:00Z","timestamp":1620777600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Comput &amp; Applic"],"published-print":{"date-parts":[[2021,11]]},"DOI":"10.1007\/s00521-021-06080-w","type":"journal-article","created":{"date-parts":[[2021,5,12]],"date-time":"2021-05-12T07:08:02Z","timestamp":1620803282000},"page":"14401-14411","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Can deep learning solve a preschool image understanding problem?"],"prefix":"10.1007","volume":"33","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8588-1913","authenticated-orcid":false,"given":"Bidyut","family":"Das","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0706-2565","authenticated-orcid":false,"given":"Arif Ahmed","family":"Sekh","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2608-5762","authenticated-orcid":false,"given":"Mukta","family":"Majumder","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7620-5518","authenticated-orcid":false,"given":"Santanu","family":"Phadikar","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,5,12]]},"reference":[{"key":"6080_CR1","doi-asserted-by":"crossref","unstructured":"Antol S, Agrawal A, Lu J, Mitchell M, Batra D, Lawrence\u00a0Zitnick C, Parikh D (2015) Vqa: visual question answering. In: Proceedings of the IEEE international conference on computer vision, pp 2425\u20132433","DOI":"10.1109\/ICCV.2015.279"},{"issue":"3","key":"6080_CR2","doi-asserted-by":"publisher","first-page":"354","DOI":"10.1177\/1073191112446655","volume":"19","author":"WB Bilker","year":"2012","unstructured":"Bilker WB, Hansen JA, Brensinger CM, Richard J, Gur RE, Gur RC (2012) Development of abbreviated nine-item forms of the Raven\u2019s standard progressive matrices test. Assessment 19(3):354\u2013369","journal-title":"Assessment"},{"key":"6080_CR3","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1109\/TLT.2018.2889100","volume":"13","author":"DR Ch","year":"2018","unstructured":"Ch DR, Saha SK (2018) Automatic multiple choice question generation from text: a survey. IEEE Trans Learn Technol 13:14\u201325","journal-title":"IEEE Trans Learn Technol"},{"key":"6080_CR4","doi-asserted-by":"crossref","unstructured":"Chen X, Zitnick CL (2014) Learning a recurrent visual representation for image caption generation. arXiv preprint arXiv:14115654","DOI":"10.1109\/CVPR.2015.7298856"},{"key":"6080_CR5","doi-asserted-by":"crossref","unstructured":"Cho K, Van\u00a0Merri\u00ebnboer B, Gulcehre C, Bahdanau D, Bougares F, Schwenk H, Bengio Y (2014) Learning phrase representations using RNN encoder-decoder for statistical machine translation. In: Proceedings of the conference on empirical methods in natural language processing (EMNLP), pp 1724\u20131734","DOI":"10.3115\/v1\/D14-1179"},{"issue":"1","key":"6080_CR6","doi-asserted-by":"publisher","first-page":"24","DOI":"10.1186\/s41239-017-0060-3","volume":"14","author":"B Das","year":"2017","unstructured":"Das B, Majumder M (2017) Factual open cloze question generation for assessment of learner\u2019s knowledge. Int J Educ Technol High Educ 14(1):24","journal-title":"Int J Educ Technol High Educ"},{"key":"6080_CR7","doi-asserted-by":"publisher","first-page":"1485","DOI":"10.1002\/cae.22163","volume":"27","author":"B Das","year":"2019","unstructured":"Das B, Majumder M, Phadikar S, Sekh AA (2019) Automatic generation of fill-in-the-blank question with corpus-based distractors for e-assessment to enhance learning. Comput Appl Eng Educ 27:1485\u20131495","journal-title":"Comput Appl Eng Educ"},{"issue":"9","key":"6080_CR8","doi-asserted-by":"publisher","first-page":"1683","DOI":"10.18520\/cs\/v113\/i09\/1683-1691","volume":"113","author":"M Divate","year":"2017","unstructured":"Divate M, Salgaonkar A (2017) Automatic question generation approaches and evaluation techniques. Curr Sci 113(9):1683","journal-title":"Curr Sci"},{"key":"6080_CR9","doi-asserted-by":"crossref","unstructured":"Duan N, Tang D, Chen P, Zhou M (2017) Question generation for question answering. In: Proceedings of the 2017 conference on empirical methods in natural language processing, pp 866\u2013874","DOI":"10.18653\/v1\/D17-1090"},{"key":"6080_CR10","doi-asserted-by":"crossref","unstructured":"Fan Z, Wei Z, Li P, Lan Y, Huang X (2018) A question type driven framework to diversify visual question generation. In: International joint conference on artificial intelligence, pp 4048\u20134054","DOI":"10.24963\/ijcai.2018\/563"},{"key":"6080_CR11","unstructured":"Gao H, Mao J, Zhou J, Huang Z, Wang L, Xu W (2015) Are you talking to a machine? dataset and methods for multilingual image question. In: Advances in neural information processing systems, pp 2296\u20132304"},{"key":"6080_CR12","doi-asserted-by":"crossref","unstructured":"Gordon D, Kembhavi A, Rastegari M, Redmon J, Fox D, Farhadi A (2018) Iqa: visual question answering in interactive environments. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4089\u20134098","DOI":"10.1109\/CVPR.2018.00430"},{"key":"6080_CR13","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"6080_CR14","unstructured":"Howard AG, Zhu M, Chen B, Kalenichenko D, Wang W, Weyand T, Andreetto M, Adam H (2017) Mobilenets: efficient convolutional neural networks for mobile vision applications. arXiv preprint arXiv:170404861"},{"key":"6080_CR15","doi-asserted-by":"crossref","unstructured":"Jain U, Zhang Z, Schwing AG (2017) Creativity: Generating diverse questions using variational autoencoders. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6485\u20136494","DOI":"10.1109\/CVPR.2017.575"},{"key":"6080_CR16","doi-asserted-by":"crossref","unstructured":"Johnson J, Karpathy A, Fei-Fei L (2016) Densecap: fully convolutional localization networks for dense captioning. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4565\u20134574","DOI":"10.1109\/CVPR.2016.494"},{"key":"6080_CR17","doi-asserted-by":"crossref","unstructured":"Johnson J, Hariharan B, van\u00a0der Maaten L, Fei-Fei L, Lawrence\u00a0Zitnick C, Girshick R (2017) Clevr: a diagnostic dataset for compositional language and elementary visual reasoning. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2901\u20132910","DOI":"10.1109\/CVPR.2017.215"},{"key":"6080_CR18","volume-title":"Speech & language processing","author":"D Jurafsky","year":"2000","unstructured":"Jurafsky D (2000) Speech & language processing. Pearson Education India, New Delhi"},{"issue":"3\u20134","key":"6080_CR19","doi-asserted-by":"publisher","first-page":"675","DOI":"10.1007\/s00521-012-1284-8","volume":"24","author":"A Karac\u0131","year":"2014","unstructured":"Karac\u0131 A, Ar\u0131c\u0131 N (2014) Determining students\u2019 level of page viewing in intelligent tutorial systems with artificial neural network. Neural Comput Appl 24(3\u20134):675\u2013684","journal-title":"Neural Comput Appl"},{"key":"6080_CR20","doi-asserted-by":"crossref","unstructured":"Karpathy A, Fei-Fei L (2015) Deep visual-semantic alignments for generating image descriptions. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3128\u20133137","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"6080_CR21","doi-asserted-by":"crossref","unstructured":"Krishna R, Bernstein M, Fei-Fei L (2019) Information maximizing visual question generation. In: IEEE conference on computer vision and pattern recognition","DOI":"10.1109\/CVPR.2019.00211"},{"key":"6080_CR22","unstructured":"Lebret R, Pinheiro PO, Collobert R (2015) Phrase-based image captioning. In: Proceedings of the international conference on machine learning research, pp 2085\u20132094"},{"key":"6080_CR23","doi-asserted-by":"crossref","unstructured":"Li Y, Duan N, Zhou B, Chu X, Ouyang W, Wang X, Zhou M (2018) Visual question generation as dual task of visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6116\u20136124","DOI":"10.1109\/CVPR.2018.00640"},{"key":"6080_CR24","doi-asserted-by":"crossref","unstructured":"Lin TY, Maire M, Belongie S, Hays J, Perona P, Ramanan D, Doll\u00e1r P, Zitnick CL (2014) Microsoft coco: common objects in context. In: European conference on computer vision. Springer, pp 740\u2013755","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"6080_CR25","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1016\/j.neucom.2016.12.038","volume":"234","author":"W Liu","year":"2017","unstructured":"Liu W, Wang Z, Liu X, Zeng N, Liu Y, Alsaadi FE (2017) A survey of deep neural network architectures and their applications. Neurocomputing 234:11\u201326","journal-title":"Neurocomputing"},{"key":"6080_CR26","doi-asserted-by":"crossref","unstructured":"Lu P, Li H, Zhang W, Wang J, Wang X (2018) Co-attending free-form regions and detections with multi-modal multiplicative feature embedding for visual question answering. In: Thirty-second association for the advancement of artificial intelligence conference on artificial intelligence, pp 1\u20138","DOI":"10.1609\/aaai.v32i1.12240"},{"key":"6080_CR27","volume-title":"Foundations of statistical natural language processing","author":"CD Manning","year":"1999","unstructured":"Manning CD, Manning CD, Sch\u00fctze H (1999) Foundations of statistical natural language processing. MIT Press, Cambridge"},{"key":"6080_CR28","unstructured":"Mora IM, de\u00a0la Puente SP, Nieto XGi (2016) Towards automatic generation of question answer pairs from images. In: Proceedings of the IEEE conference on computer vision and pattern recognition workshops, pp 1\u20132"},{"key":"6080_CR29","doi-asserted-by":"crossref","unstructured":"Mostafazadeh N, Misra I, Devlin J, Mitchell M, He X, Vanderwende L (2016) Generating natural questions about an image. In: Proceedings of the 54th annual meeting of the Association for Computational Linguistics, pp 1802\u20131813","DOI":"10.18653\/v1\/P16-1170"},{"key":"6080_CR30","unstructured":"Mostafazadeh N, Brockett C, Dolan B, Galley M, Gao J, Spithourakis G, Vanderwende L (2017) Image-grounded conversations: Multimodal context for natural question and response generation. In: Proceedings of the eighth international joint conference on natural language processing, pp 462\u2013472"},{"key":"6080_CR31","doi-asserted-by":"crossref","unstructured":"Nallapati R, Zhou B, Gulcehre C, Xiang B, et\u00a0al (2016) Abstractive text summarization using sequence-to-sequence RNNs and beyond. In: Proceedings of The 20th SIGNLL conference on computational natural language learning, pp 280\u2013290","DOI":"10.18653\/v1\/K16-1028"},{"key":"6080_CR32","doi-asserted-by":"crossref","unstructured":"Papineni K, Roukos S, Ward T, Zhu WJ (2002) Bleu: a method for automatic evaluation of machine translation. In: Proceedings of the 40th annual meeting of the Association for Computational Linguistics, pp 311\u2013318","DOI":"10.3115\/1073083.1073135"},{"key":"6080_CR33","doi-asserted-by":"crossref","unstructured":"Prentzas J (2013) Artificial intelligence methods in early childhood education. In: Artificial intelligence, evolutionary computing and metaheuristics. Springer, pp 169\u2013199","DOI":"10.1007\/978-3-642-29694-9_8"},{"key":"6080_CR34","doi-asserted-by":"crossref","unstructured":"Redmon J, Divvala S, Girshick R, Farhadi A (2016) You only look once: unified, real-time object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 779\u2013788","DOI":"10.1109\/CVPR.2016.91"},{"key":"6080_CR35","unstructured":"Ren M, Kiros R, Zemel R (2015) Exploring models and data for image question answering. In: Advances in neural information processing systems, pp 2953\u20132961"},{"key":"6080_CR36","doi-asserted-by":"crossref","unstructured":"Sak H, Senior A, Beaufays F (2014) Long short-term memory recurrent neural network architectures for large scale acoustic modeling. In: Fifteenth annual conference of the International Speech Communication Association, pp 338\u2013342","DOI":"10.21437\/Interspeech.2014-80"},{"key":"6080_CR37","unstructured":"Santoro A, Hill F, Barrett D, Morcos A, Lillicrap T (2018) Measuring abstract reasoning in neural networks. In: International conference on machine learning, pp 4477\u20134486"},{"key":"6080_CR38","doi-asserted-by":"crossref","unstructured":"Serban IV, Garcia-Duran A, Gulcehre C, Ahn S, Chandar S, Courville A, Bengio Y (2016) Generating factoid questions with recurrent neural networks: the 30m factoid question\u2013answer corpus. In: Proceedings of the 54th annual meeting of the Association for Computational Linguistics, pp 588\u2013598","DOI":"10.18653\/v1\/P16-1056"},{"issue":"1","key":"6080_CR39","doi-asserted-by":"publisher","first-page":"1193","DOI":"10.1146\/annurev.neuro.24.1.1193","volume":"24","author":"EP Simoncelli","year":"2001","unstructured":"Simoncelli EP, Olshausen BA (2001) Natural image statistics and neural representation. Annu Rev Neurosci 24(1):1193\u20131216","journal-title":"Annu Rev Neurosci"},{"key":"6080_CR40","unstructured":"Simonyan K, Zisserman A (2014) Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:14091556"},{"issue":"4","key":"6080_CR41","doi-asserted-by":"publisher","first-page":"379","DOI":"10.1007\/s41095-016-0059-z","volume":"2","author":"J Song","year":"2016","unstructured":"Song J, Tang S, Xiao J, Wu F, Zhang ZM (2016) LSTM-in-LSTM for generating long descriptions of images. Comput Vis Media 2(4):379\u2013388","journal-title":"Comput Vis Media"},{"key":"6080_CR42","doi-asserted-by":"crossref","unstructured":"Suhr A, Zhou S, Zhang A, Zhang I, Bai H, Artzi Y (2019) A corpus for reasoning about natural language grounded in photographs. In: Proceedings of the 57th annual meeting of the Association for Computational Linguistics, pp 6418\u20136428","DOI":"10.18653\/v1\/P19-1644"},{"key":"6080_CR43","doi-asserted-by":"publisher","first-page":"42","DOI":"10.1016\/j.neucom.2018.03.030","volume":"299","author":"X Sun","year":"2018","unstructured":"Sun X, Wu P, Hoi SC (2018) Face detection using deep learning: an improved faster RCNN approach. Neurocomputing 299:42\u201350","journal-title":"Neurocomputing"},{"key":"6080_CR44","unstructured":"Sutskever I, Vinyals O, Le Q (2014) Sequence to sequence learning with neural networks. In: Advances in neural information processing systems"},{"key":"6080_CR45","doi-asserted-by":"crossref","unstructured":"Uehara K, Tejero-De-Pablos A, Ushiku Y, Harada T (2018) Visual question generation for class acquisition of unknown objects. In: Proceedings of the European conference on computer vision (ECCV), pp 481\u2013496","DOI":"10.1007\/978-3-030-01258-8_30"},{"key":"6080_CR46","doi-asserted-by":"crossref","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2015) Show and tell: a neural image caption generator. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3156\u20133164","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"6080_CR47","doi-asserted-by":"crossref","unstructured":"Wang J, Yang Y, Mao J, Huang Z, Huang C, Xu W (2016) CNN-RNN: a unified framework for multi-label image classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2285\u20132294","DOI":"10.1109\/CVPR.2016.251"},{"key":"6080_CR48","doi-asserted-by":"crossref","unstructured":"Wang X, Shrivastava A, Gupta A (2017) A-fast-RCNN: hard positive generation via adversary for object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2606\u20132615","DOI":"10.1109\/CVPR.2017.324"},{"key":"6080_CR49","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, attend and tell: neural image caption generation with visual attention. In: International conference on machine learning, pp 2048\u20132057"},{"key":"6080_CR50","doi-asserted-by":"crossref","unstructured":"Yu D, Fu J, Mei T, Rui Y (2017) Multi-level attention networks for visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4709\u20134717","DOI":"10.1109\/CVPR.2017.446"},{"key":"6080_CR51","doi-asserted-by":"crossref","unstructured":"Yu L, Park E, Berg AC, Berg TL (2015) Visual madlibs: fill in the blank description generation and question answering. In: Proceedings of the IEEE international conference on computer vision, pp 2461\u20132469","DOI":"10.1109\/ICCV.2015.283"},{"key":"6080_CR52","doi-asserted-by":"crossref","unstructured":"Zhang S, Qu L, You S, Yang Z, Zhang J (2017) Automatic generation of grounded visual questions. In: Proceedings of the 26th international joint conference on artificial intelligence, pp 4235\u20134243","DOI":"10.24963\/ijcai.2017\/592"},{"key":"6080_CR53","unstructured":"Zhou B, Tian Y, Sukhbaatar S, Szlam A, Fergus R (2015) Simple baseline for visual question answering. arXiv preprint arXiv:151202167"},{"key":"6080_CR54","doi-asserted-by":"crossref","unstructured":"Zhu Y, Groth O, Bernstein M, Fei-Fei L (2016) Visual7w: grounded question answering in images. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4995\u20135004","DOI":"10.1109\/CVPR.2016.540"}],"container-title":["Neural Computing and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-021-06080-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00521-021-06080-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-021-06080-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,27]],"date-time":"2022-12-27T02:42:24Z","timestamp":1672108944000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00521-021-06080-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,5,12]]},"references-count":54,"journal-issue":{"issue":"21","published-print":{"date-parts":[[2021,11]]}},"alternative-id":["6080"],"URL":"https:\/\/doi.org\/10.1007\/s00521-021-06080-w","relation":{},"ISSN":["0941-0643","1433-3058"],"issn-type":[{"value":"0941-0643","type":"print"},{"value":"1433-3058","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,5,12]]},"assertion":[{"value":"22 July 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 April 2021","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 May 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declaration"}},{"value":"Authors declare no conflict of interest","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}