{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,16]],"date-time":"2025-10-16T10:08:22Z","timestamp":1760609302918},"reference-count":57,"publisher":"Springer Science and Business Media LLC","issue":"41-42","license":[{"start":{"date-parts":[[2020,8,15]],"date-time":"2020-08-15T00:00:00Z","timestamp":1597449600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,8,15]],"date-time":"2020-08-15T00:00:00Z","timestamp":1597449600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2020,11]]},"DOI":"10.1007\/s11042-020-09539-5","type":"journal-article","created":{"date-parts":[[2020,8,15]],"date-time":"2020-08-15T10:06:19Z","timestamp":1597485979000},"page":"30615-30635","update-policy":"http:\/\/dx.doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":28,"title":["Reference-based model using multimodal gated recurrent units for image captioning"],"prefix":"10.1007","volume":"79","author":[{"given":"Tiago","family":"do Carmo Nogueira","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"C\u00e1ssio Dener Noronha","family":"Vinhal","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"G\u00e9lson","family":"da Cruz J\u00fanior","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Matheus Rudolfo Diedrich","family":"Ullmann","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,8,15]]},"reference":[{"key":"9539_CR1","doi-asserted-by":"crossref","unstructured":"Al-Muzaini HA, Al-Yahya TN, Benhidour H (2018) Automatic arabic image captioning using rnn-lstm-based language model and cnn. database 9(6)","DOI":"10.14569\/IJACSA.2018.090610"},{"key":"9539_CR2","doi-asserted-by":"crossref","unstructured":"Aneja J, Deshpande A, Schwing AG (2018) Convolutional image captioning. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5561\u20135570","DOI":"10.1109\/CVPR.2018.00583"},{"key":"9539_CR3","unstructured":"Banerjee S, Lavie A (2005) Meteor: An automatic metric for mt evaluation with improved correlation with human judgments. In: Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and\/or summarization, pp. 65\u201372"},{"key":"9539_CR4","unstructured":"Barratt S, Sharma R (2018) A note on the inception score. arXiv preprint arXiv:1801.01973"},{"issue":"3","key":"9539_CR5","doi-asserted-by":"publisher","first-page":"2959","DOI":"10.1007\/s11042-017-4593-1","volume":"77","author":"YS Chang","year":"2018","unstructured":"Chang YS (2018) Fine-grained attention for image caption generation. Multimed Tools Appl 77(3):2959\u20132971","journal-title":"Multimed Tools Appl"},{"key":"9539_CR6","unstructured":"Chen X, Fang H, Lin TY, Vedantam R, Gupta S, Doll\u00e1r P, Zitnick CL (2015) Microsoft coco captions: Data collection and evaluation server. arXiv preprint arXiv:1504.00325"},{"key":"9539_CR7","doi-asserted-by":"crossref","unstructured":"Cho K, Van Merri\u00ebnboer B, Gulcehre C, Bahdanau D, Bougares F, Schwenk H, Bengio Y (2014) Learning phrase representations using rnn encoder-decoder for statistical machine translation. arXiv preprint arXiv:1406.1078","DOI":"10.3115\/v1\/D14-1179"},{"key":"9539_CR8","unstructured":"Chung J, Gulcehre C, Cho K, Bengio Y (2014) Empirical evaluation of gated recurrent neural networks on sequence modeling. arXiv preprint arXiv:1412.3555"},{"key":"9539_CR9","unstructured":"Chung J, Gulcehre C, Cho K, Bengio Y (2015) Gated feedback recurrent neural networks. In: International Conference on Machine Learning, pp. 2067\u20132075"},{"key":"9539_CR10","unstructured":"Cohen E, Beck C (2019) Empirical analysis of beam search performance degradation in neural sequence models. In: International Conference on Machine Learning, pp. 1290\u20131299"},{"key":"9539_CR11","doi-asserted-by":"crossref","unstructured":"Deshpande A, Aneja J, Wang L, Schwing AG, Forsyth D (2019) Fast, diverse and accurate image captioning guided by part-of-speech. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 10695\u201310704","DOI":"10.1109\/CVPR.2019.01095"},{"key":"9539_CR12","unstructured":"Devlin J, Gupta S, Girshick R, Mitchell M, Zitnick CL (2015) Exploring nearest neighbor approaches for image captioning. arXiv preprint arXiv:1505.04467"},{"key":"9539_CR13","unstructured":"Ding G, Chen M, Zhao S, Chen H, Han J, Liu Q (2018) Neural image caption generation with weighted training and reference. Cognitive Computation pp. 1\u201315"},{"key":"9539_CR14","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1016\/j.patrec.2019.03.021","volume":"123","author":"S Ding","year":"2019","unstructured":"Ding S, Qu S, Xi Y, Sangaiah AK, Wan S (2019) Image caption generation with high-level image features. Pattern Recogn Lett 123:89\u201395","journal-title":"Pattern Recogn Lett"},{"key":"9539_CR15","unstructured":"Dognin P, Melnyk I, Mroueh Y, Ross J, Sercu T (2019) Improved adversarial image captioning. ICLR 2019 Workshop DeepGenStruct"},{"key":"9539_CR16","unstructured":"Fakoor R, Mohamed AR, Mitchell M, Kang SB, Kohli P (2016) Memory-augmented attention modelling for videos. arXiv preprint arXiv:1611.02261"},{"key":"9539_CR17","doi-asserted-by":"crossref","unstructured":"Gao L, Wang B, Wang W (2018) Image captioning with scene-graph based semantic concepts. In: Proceedings of the 2018 10th International Conference on Machine Learning and Computing, pp. 225\u2013229. ACM","DOI":"10.1145\/3195106.3195114"},{"issue":"5","key":"9539_CR18","first-page":"1112","volume":"42","author":"L Gao","year":"2019","unstructured":"Gao L, Li X, Song J, Shen HT (2019) Hierarchical lstms with adaptive attention for visual captioning. IEEE Trans Pattern Anal Mach Intell 42(5):1112\u20131131","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"1","key":"9539_CR19","doi-asserted-by":"publisher","first-page":"177","DOI":"10.1007\/s11063-018-9807-7","volume":"49","author":"C He","year":"2019","unstructured":"He C, Hu H (2019) Image captioning with text-based visual attention. Neural Process Lett 49(1):177\u2013185","journal-title":"Neural Process Lett"},{"key":"9539_CR20","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2015) Delving deep into rectifiers: Surpassing human-level performance on imagenet classification. In: Proceedings of the IEEE international conference on computer vision, pp. 1026\u20131034","DOI":"10.1109\/ICCV.2015.123"},{"key":"9539_CR21","unstructured":"He X, Shi B, Bai X, Xia GS, Zhang Z, Dong W (2017) Image caption generation with part of speech guidance. Pattern Recogn Lett"},{"key":"9539_CR22","doi-asserted-by":"publisher","first-page":"48","DOI":"10.1016\/j.neucom.2018.02.106","volume":"328","author":"X He","year":"2019","unstructured":"He X, Yang Y, Shi B, Bai X (2019) Vd-san: visual-densely semantic attention network for image caption generation. Neurocomputing 328:48\u201355","journal-title":"Neurocomputing"},{"key":"9539_CR23","doi-asserted-by":"crossref","unstructured":"Jia X, Gavves E, Fernando B, Tuytelaars T (2015) Guiding the long-short term memory model for image caption generation. In: Proceedings of the IEEE international conference on computer vision, pp. 2407\u20132415","DOI":"10.1109\/ICCV.2015.277"},{"key":"9539_CR24","doi-asserted-by":"crossref","unstructured":"Lavie A, Agarwal A (2007) Meteor: An automatic metric for mt evaluation with high levels of correlation with human judgments. In: Proceedings of the Second Workshop on Statistical Machine Translation, pp. 228\u2013231. Association for Computational Linguistics","DOI":"10.3115\/1626355.1626389"},{"issue":"1","key":"9539_CR25","doi-asserted-by":"publisher","first-page":"104","DOI":"10.1049\/iet-cvi.2015.0473","volume":"11","author":"S Li","year":"2016","unstructured":"Li S, Zhang J, Guo Q, Lei J, Tu D (2016) Generating image descriptions with multidirectional 2d long short-term memory. IET Comput Vis 11(1):104\u2013111","journal-title":"IET Comput Vis"},{"key":"9539_CR26","doi-asserted-by":"crossref","unstructured":"Li L, Tang S, Deng L, Zhang Y, Tian Q (2017) Image caption with global-local attention. In: Thirty-First AAAI Conference on Artificial Intelligence","DOI":"10.1609\/aaai.v31i1.11236"},{"issue":"22","key":"9539_CR27","doi-asserted-by":"publisher","first-page":"29847","DOI":"10.1007\/s11042-018-5856-1","volume":"77","author":"X Li","year":"2018","unstructured":"Li X, Yuan A, Lu X (2018) Multi-modal gated recurrent units for image description. Multimed Tools Appl 77(22):29847\u201329869","journal-title":"Multimed Tools Appl"},{"key":"9539_CR28","unstructured":"Lin CY (2004) Rouge: A package for automatic evaluation of summaries. In: Text summarization branches out, pp. 74\u201381"},{"key":"9539_CR29","doi-asserted-by":"crossref","unstructured":"Lin TY, Maire M, Belongie S, Hays J, Perona P, Ramanan D, Doll\u00e1r P, Zitnick CL (2014) Microsoft coco: Common objects in context. In: European conference on computer vision, pp. 740\u2013755. Springer","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"9539_CR30","doi-asserted-by":"crossref","unstructured":"Liu D, Hua XS, Yang L, Wang M, Zhang HJ (2009) Tag ranking. In: Proceedings of the 18th international conference on World wide web, pp. 351\u2013360","DOI":"10.1145\/1526709.1526757"},{"key":"9539_CR31","unstructured":"Luo RC, Chang Lin H (2019) Coping with overfitting problems of image caption models for service robotics applications. In: 2019 IEEE International Conference on Industrial Cyber Physical Systems (ICPS), pp. 815\u2013820"},{"key":"9539_CR32","unstructured":"Mao J, Xu W, Yang Y, Wang J, Huang Z, Yuille A (2014) Deep captioning with multimodal recurrent neural networks (m-rnn). arXiv preprint arXiv:1412.6632"},{"key":"9539_CR33","doi-asserted-by":"crossref","unstructured":"Nakashima K, Iwashita Y, Kawamura A, Kurazume R (2018) Fourth-person captioning: Describing daily events by uni-supervised and tri-regularized training. In: 2018 IEEE International Conference on Systems, Man, and Cybernetics (SMC), pp. 2122\u20132127. IEEE","DOI":"10.1109\/SMC.2018.00365"},{"key":"9539_CR34","doi-asserted-by":"crossref","unstructured":"Nezami OM, Dras M, Wan S, Paris C, Hamey L (2019) Towards generating stylized image captions via adversarial training. In: Pacific Rim International Conference on Artificial Intelligence, pp. 270\u2013284. Springer","DOI":"10.1007\/978-3-030-29908-8_22"},{"key":"9539_CR35","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.imavis.2019.03.003","volume":"86","author":"Y Peng","year":"2019","unstructured":"Peng Y, Liu X, Wang W, Zhao X, Wei M (2019) Image caption model of double lstm with scene factors. Image Vis Comput 86:38\u201344","journal-title":"Image Vis Comput"},{"issue":"2","key":"9539_CR36","doi-asserted-by":"publisher","first-page":"575","DOI":"10.32604\/cmc.2019.05569","volume":"59","author":"Z Qu","year":"2019","unstructured":"Qu Z, Cao B, Wang X, Li F, Xu P, Zhang L (2019) Feedback lstm network based on attention for image description generator. CMC-Comput Mater Contin 59(2):575\u2013589","journal-title":"CMC-Comput Mater Contin"},{"key":"9539_CR37","unstructured":"Rashtchian C, Young P, Hodosh M, Hockenmaier J (2010) Collecting image annotations using amazon\u2019s mechanical turk. In: Proceedings of the NAACL HLT 2010 Workshop on Creating Speech and Language Data with Amazon\u2019s Mechanical Turk, pp. 139\u2013147. Association for Computational Linguistics"},{"issue":"2","key":"9539_CR38","doi-asserted-by":"publisher","first-page":"92","DOI":"10.1109\/TETCI.2017.2762739","volume":"2","author":"M Ravanelli","year":"2018","unstructured":"Ravanelli M, Brakel P, Omologo M, Bengio Y (2018) Light gated recurrent units for speech recognition. IEEE Transact Emerg Topics Comput Intell 2(2):92\u2013102","journal-title":"IEEE Transact Emerg Topics Comput Intell"},{"key":"9539_CR39","doi-asserted-by":"crossref","unstructured":"Sharma G, Kalena P, Malde N, Nair A, Parkar S (2019) Visual image caption generator using deep learning. Available at SSRN 3368837","DOI":"10.2139\/ssrn.3368837"},{"key":"9539_CR40","doi-asserted-by":"crossref","unstructured":"Shi Y, Ling H, Wu L, Shen J, Li P (2020) Learning refined attribute-aligned network with attribute selection for person re-identification. Neurocomputing p. 22071","DOI":"10.1016\/j.neucom.2020.03.057"},{"key":"9539_CR41","doi-asserted-by":"publisher","first-page":"207","DOI":"10.1162\/tacl_a_00177","volume":"2","author":"R Socher","year":"2014","unstructured":"Socher R, Karpathy A, Le QV, Manning CD, Ng AY (2014) Grounded compositional semantics for finding and describing images with sentences. Transact Assoc Comput Linguist 2:207\u2013218","journal-title":"Transact Assoc Comput Linguist"},{"issue":"10","key":"9539_CR42","doi-asserted-by":"publisher","first-page":"3047","DOI":"10.1109\/TNNLS.2018.2851077","volume":"30","author":"J Song","year":"2018","unstructured":"Song J, Guo Y, Gao L, Li X, Hanjalic A, Shen HT (2018) From deterministic to generative: multimodal stochastic rnns for video captioning. IEEE Transact Neur Netw Learn Syst 30(10):3047\u20133058","journal-title":"IEEE Transact Neur Netw Learn Syst"},{"key":"9539_CR43","doi-asserted-by":"crossref","unstructured":"Song J, He T, Gao L, Xu X, Hanjalic A, Shen HT (2020) Unified binary generative adversarial network for image retrieval and compression. International Journal of Computer Vision pp. 1\u201322","DOI":"10.1007\/s11263-020-01305-2"},{"key":"9539_CR44","doi-asserted-by":"crossref","unstructured":"Szegedy C, Vanhoucke V, Ioffe S, Shlens J, Wojna Z (2016) Rethinking the inception architecture for computer vision. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 2818\u20132826","DOI":"10.1109\/CVPR.2016.308"},{"key":"9539_CR45","doi-asserted-by":"publisher","first-page":"86","DOI":"10.1016\/j.neucom.2018.12.026","volume":"333","author":"YH Tan","year":"2019","unstructured":"Tan YH, Chan CS (2019) Phrase-based image caption generator with hierarchical lstm network. Neurocomputing 333:86\u2013100","journal-title":"Neurocomputing"},{"key":"9539_CR46","doi-asserted-by":"crossref","unstructured":"Vedantam R, Lawrence Zitnick C, Parikh D (2015) Cider: Consensus-based image description evaluation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 4566\u20134575","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"9539_CR47","doi-asserted-by":"crossref","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2015) Show and tell: A neural image caption generator. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 3156\u20133164","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"9539_CR48","doi-asserted-by":"crossref","unstructured":"Wang Y, Liu J, Wang X (2017) Image caption with synchronous cross-attention. In: Proceedings of the on Thematic Workshops of ACM Multimedia 2017, pp. 433\u2013441. ACM","DOI":"10.1145\/3126686.3126714"},{"key":"9539_CR49","doi-asserted-by":"crossref","unstructured":"Wang L, Qian X, Zhang Y, Shen J, Cao X (2019) Enhancing sketch-based image retrieval by cnn semantic re-ranking. IEEE Transact Cybernet","DOI":"10.1109\/TCYB.2019.2894498"},{"key":"9539_CR50","unstructured":"Wei W, Cheng L, Mao X, Zhou G, Zhu F (2019) Stack-vs: Stacked visual-semantic attention for image caption generation. arXiv preprint arXiv:1909.02489"},{"key":"9539_CR51","doi-asserted-by":"crossref","unstructured":"Wu L, Yang L, Yu N, Hua XS (2009) Learning to tag. In: Proceedings of the 18th international conference on World wide web, pp. 361\u2013370","DOI":"10.1145\/1526709.1526758"},{"key":"9539_CR52","doi-asserted-by":"crossref","unstructured":"Wu C, Wang C, Zhou Y, Wu D, Chen M, Wang JH, Qin J (2020) Exploiting user reviews for automatic movie tagging. Multimedia Tools and Applications pp. 1\u201321","DOI":"10.1007\/s11042-019-7523-6"},{"key":"9539_CR53","doi-asserted-by":"publisher","first-page":"17","DOI":"10.1016\/j.neucom.2018.10.059","volume":"330","author":"A Yuan","year":"2019","unstructured":"Yuan A, Li X, Lu X (2019) 3g structure for image caption generation. Neurocomputing 330:17\u201328","journal-title":"Neurocomputing"},{"key":"9539_CR54","unstructured":"Zheng J, Krishnamurthy S, Chen R, Chen MH, Ge Z, Li X (2019) Image captioning with integrated bottom-up and multi-level residual top-down attention for game scene understanding. arXiv preprint arXiv:1906.06632"},{"key":"9539_CR55","doi-asserted-by":"crossref","unstructured":"Zhou L, Xu C, Koch P, Corso JJ (2017) Watch what you just said: Image captioning with text-conditional attention. In: Proceedings of the on Thematic Workshops of ACM Multimedia 2017, pp. 305\u2013313. ACM","DOI":"10.1145\/3126686.3126717"},{"key":"9539_CR56","doi-asserted-by":"publisher","first-page":"51810","DOI":"10.1109\/ACCESS.2019.2911983","volume":"7","author":"W Zhu","year":"2019","unstructured":"Zhu W, Yao T, Zhang W, Wei B (2019) Part-of-speech-based long short-term memory network for learning sentence representations. IEEE Access 7:51810\u201351816","journal-title":"IEEE Access"},{"key":"9539_CR57","doi-asserted-by":"crossref","unstructured":"Zou F, Shen L, Jie Z, Zhang W, Liu W (2019) A sufficient condition for convergences of adam and rmsprop. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 11127\u201311135","DOI":"10.1109\/CVPR.2019.01138"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09539-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-020-09539-5\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09539-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,7]],"date-time":"2022-11-07T02:03:11Z","timestamp":1667786591000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-020-09539-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,8,15]]},"references-count":57,"journal-issue":{"issue":"41-42","published-print":{"date-parts":[[2020,11]]}},"alternative-id":["9539"],"URL":"https:\/\/doi.org\/10.1007\/s11042-020-09539-5","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,8,15]]},"assertion":[{"value":"29 January 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 July 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 August 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 August 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}