{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,28]],"date-time":"2026-01-28T06:29:23Z","timestamp":1769581763565,"version":"3.49.0"},"reference-count":38,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2022,5,9]],"date-time":"2022-05-09T00:00:00Z","timestamp":1652054400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,5,9]],"date-time":"2022-05-09T00:00:00Z","timestamp":1652054400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2023,6]]},"DOI":"10.1007\/s00530-022-00937-3","type":"journal-article","created":{"date-parts":[[2022,5,9]],"date-time":"2022-05-09T06:03:30Z","timestamp":1652076210000},"page":"1665-1681","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":11,"title":["A reference-based model using deep learning for image captioning"],"prefix":"10.1007","volume":"29","author":[{"given":"Tiago","family":"do Carmo Nogueira","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"C\u00e1ssio Dener Noronha","family":"Vinhal","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"G\u00e9lson","family":"da Cruz J\u00fanior","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Matheus Rudolfo Diedrich","family":"Ullmann","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Thyago Carvalho","family":"Marques","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,5,9]]},"reference":[{"key":"937_CR1","doi-asserted-by":"crossref","unstructured":"Al-Muzaini, H.A., Al-Yahya, T.N., Benhidour, H.: Automatic arabic image captioning using rnn-lstm-based language model and cnn. database 9(6), (2018)","DOI":"10.14569\/IJACSA.2018.090610"},{"key":"937_CR2","doi-asserted-by":"publisher","first-page":"107856","DOI":"10.1016\/j.patcog.2021.107856","volume":"114","author":"H Ayesha","year":"2021","unstructured":"Ayesha, H., Iqbal, S., Tariq, M., Abrar, M., Sanaullah, M., Abbas, I., Rehman, A., Niazi, M.F.K., Hussain, S.: Automatic medical image interpretation: state of the art and future directions. Pattern Recognit. 114, 107856 (2021)","journal-title":"Pattern Recognit."},{"key":"937_CR3","unstructured":"Banerjee, S., Lavie, A.: Meteor: an automatic metric for mt evaluation with improved correlation with human judgments. In: Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and\/or summarization, pp. 65\u201372 (2005)"},{"key":"937_CR4","unstructured":"Barratt, S., Sharma, R.: A note on the inception score. arXiv preprint arXiv:1801.01973 (2018)"},{"issue":"3","key":"937_CR5","doi-asserted-by":"publisher","first-page":"2959","DOI":"10.1007\/s11042-017-4593-1","volume":"77","author":"YS Chang","year":"2018","unstructured":"Chang, Y.S.: Fine-grained attention for image caption generation. Multimed. Tools Appl. 77(3), 2959\u20132971 (2018)","journal-title":"Multimed. Tools Appl."},{"key":"937_CR6","unstructured":"Cohen, E., Beck, C.: Empirical analysis of beam search performance degradation in neural sequence models. In: International Conference on Machine Learning, pp. 1290\u20131299 (2019)"},{"key":"937_CR7","doi-asserted-by":"crossref","unstructured":"Deshpande, A., Aneja, J., Wang, L., Schwing, A.G., Forsyth, D.: Fast, diverse and accurate image captioning guided by part-of-speech. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 10695\u201310704 (2019)","DOI":"10.1109\/CVPR.2019.01095"},{"key":"937_CR8","unstructured":"Devlin, J., Gupta, S., Girshick, R., Mitchell, M., Zitnick, C.L.: Exploring nearest neighbor approaches for image captioning. arXiv preprint arXiv:1505.04467 (2015)"},{"key":"937_CR9","doi-asserted-by":"publisher","first-page":"763","DOI":"10.1007\/s12559-018-9581-x","volume":"11","author":"G Ding","year":"2018","unstructured":"Ding, G., Chen, M., Zhao, S., Chen, H., Han, J., Liu, Q.: Neural image caption generation with weighted training and reference. Cogn. Comput. 11, 763\u2013777 (2018)","journal-title":"Cogn. Comput."},{"key":"937_CR10","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1016\/j.patrec.2019.03.021","volume":"123","author":"S Ding","year":"2019","unstructured":"Ding, S., Qu, S., Xi, Y., Sangaiah, A.K., Wan, S.: Image caption generation with high-level image features. Pattern Recogn. Lett. 123, 89\u201395 (2019)","journal-title":"Pattern Recogn. Lett."},{"key":"937_CR11","doi-asserted-by":"crossref","unstructured":"Gao, L., Wang, B., Wang, W.: Image captioning with scene-graph based semantic concepts. In: Proceedings of the 2018 10th International Conference on Machine Learning and Computing, pp. 225\u2013229. ACM (2018)","DOI":"10.1145\/3195106.3195114"},{"key":"937_CR12","doi-asserted-by":"publisher","first-page":"012015","DOI":"10.1088\/1742-6596\/1712\/1\/012015","volume":"1712","author":"G Geetha","year":"2020","unstructured":"Geetha, G., Kirthigadevi, T., Ponsam, G.G., Karthik, T., Safa, M.: Image captioning using deep convolutional neural networks (cnns). J. Phys. Conf. Ser. 1712, 012015 (2020)","journal-title":"J. Phys. Conf. Ser."},{"issue":"1","key":"937_CR13","doi-asserted-by":"publisher","first-page":"177","DOI":"10.1007\/s11063-018-9807-7","volume":"49","author":"C He","year":"2019","unstructured":"He, C., Hu, H.: Image captioning with text-based visual attention. Neural Process. Lett. 49(1), 177\u2013185 (2019)","journal-title":"Neural Process. Lett."},{"key":"937_CR14","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Delving deep into rectifiers: surpassing human-level performance on imagenet classification. In: Proceedings of the IEEE international conference on computer vision, pp. 1026\u20131034 (2015)","DOI":"10.1109\/ICCV.2015.123"},{"key":"937_CR15","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1016\/j.patrec.2017.10.018","volume":"119","author":"X He","year":"2017","unstructured":"He, X., Shi, B., Bai, X., Xia, G.S., Zhang, Z., Dong, W.: Image caption generation with part of speech guidance. Pattern Recogn. Lett. 119, 229\u2013237 (2017)","journal-title":"Pattern Recogn. Lett."},{"key":"937_CR16","doi-asserted-by":"publisher","first-page":"48","DOI":"10.1016\/j.neucom.2018.02.106","volume":"328","author":"X He","year":"2019","unstructured":"He, X., Yang, Y., Shi, B., Bai, X.: Vd-san: visual-densely semantic attention network for image caption generation. Neurocomputing 328, 48\u201355 (2019)","journal-title":"Neurocomputing"},{"key":"937_CR17","doi-asserted-by":"crossref","unstructured":"Jia, X., Gavves, E., Fernando, B., Tuytelaars, T.: Guiding the long-short term memory model for image caption generation. In: Proceedings of the IEEE international conference on computer vision, pp. 2407\u20132415 (2015)","DOI":"10.1109\/ICCV.2015.277"},{"issue":"1","key":"937_CR18","first-page":"239","volume":"41","author":"S Kalra","year":"2020","unstructured":"Kalra, S., Leekha, A.: Survey of convolutional neural networks for image captioning. J. Inf. Optimiz. Sci. 41(1), 239\u2013260 (2020)","journal-title":"J. Inf. Optimiz. Sci."},{"key":"937_CR19","doi-asserted-by":"crossref","unstructured":"Katpally, H., Bansal, A.: Ensemble learning on deep neural networks for image caption generation. In: 2020 IEEE 14th international conference on semantic computing (ICSC), pp. 61\u201368. IEEE (2020)","DOI":"10.1109\/ICSC.2020.00016"},{"issue":"Sep","key":"937_CR20","first-page":"2529","volume":"13","author":"J Kim","year":"2012","unstructured":"Kim, J., Scott, C.D.: Robust kernel density estimation. J. Mach. Learn. Res. 13(Sep), 2529\u20132565 (2012)","journal-title":"J. Mach. Learn. Res."},{"issue":"1","key":"937_CR21","doi-asserted-by":"publisher","first-page":"104","DOI":"10.1049\/iet-cvi.2015.0473","volume":"11","author":"S Li","year":"2016","unstructured":"Li, S., Zhang, J., Guo, Q., Lei, J., Tu, D.: Generating image descriptions with multidirectional 2d long short-term memory. IET Comput. Vis. 11(1), 104\u2013111 (2016)","journal-title":"IET Comput. Vis."},{"issue":"22","key":"937_CR22","doi-asserted-by":"publisher","first-page":"29847","DOI":"10.1007\/s11042-018-5856-1","volume":"77","author":"X Li","year":"2018","unstructured":"Li, X., Yuan, A., Lu, X.: Multi-modal gated recurrent units for image description. Multimed. Tools Appl. 77(22), 29847\u201329869 (2018)","journal-title":"Multimed. Tools Appl."},{"key":"937_CR23","unstructured":"Lin, C.Y.: Rouge: a package for automatic evaluation of summaries. In: Text summarization branches out, pp. 74\u201381 (2004)"},{"key":"937_CR24","unstructured":"Mao, J., Xu, W., Yang, Y., Wang, J., Huang, Z., Yuille, A.: Deep captioning with multimodal recurrent neural networks (m-rnn). arXiv preprint arXiv:1412.6632 (2014)"},{"key":"937_CR25","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.imavis.2019.03.003","volume":"86","author":"Y Peng","year":"2019","unstructured":"Peng, Y., Liu, X., Wang, W., Zhao, X., Wei, M.: Image caption model of double lstm with scene factors. Image Vis. Comput. 86, 38\u201344 (2019)","journal-title":"Image Vis. Comput."},{"issue":"2","key":"937_CR26","doi-asserted-by":"publisher","first-page":"575","DOI":"10.32604\/cmc.2019.05569","volume":"59","author":"Z Qu","year":"2019","unstructured":"Qu, Z., Cao, B., Wang, X., Li, F., Xu, P., Zhang, L.: Feedback lstm network based on attention for image description generator. CMC-Comput. Mater. Continua 59(2), 575\u2013589 (2019)","journal-title":"CMC-Comput. Mater. Continua"},{"key":"937_CR27","unstructured":"Seshadri, M., Srikanth, M., Belov, M.: Image to language understanding: captioning approach. arXiv preprint arXiv:2002.09536 (2020)"},{"key":"937_CR28","doi-asserted-by":"crossref","unstructured":"Sharma, G., Kalena, P., Malde, N., Nair, A., Parkar, S.: Visual image caption generator using deep learning. Available at SSRN 3368837 (2019)","DOI":"10.2139\/ssrn.3368837"},{"key":"937_CR29","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014)"},{"key":"937_CR30","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Vanhoucke, V., Ioffe, S., Shlens, J., Wojna, Z.: Rethinking the inception architecture for computer vision. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 2818\u20132826 (2016)","DOI":"10.1109\/CVPR.2016.308"},{"key":"937_CR31","doi-asserted-by":"publisher","first-page":"86","DOI":"10.1016\/j.neucom.2018.12.026","volume":"333","author":"YH Tan","year":"2019","unstructured":"Tan, Y.H., Chan, C.S.: Phrase-based image caption generator with hierarchical lstm network. Neurocomputing 333, 86\u2013100 (2019)","journal-title":"Neurocomputing"},{"key":"937_CR32","doi-asserted-by":"crossref","unstructured":"Vedantam, R., Lawrence Zitnick, C., Parikh, D.: Cider: Consensus-based image description evaluation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 4566\u20134575 (2015)","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"937_CR33","doi-asserted-by":"crossref","unstructured":"Vinyals, O., Toshev, A., Bengio, S., Erhan, D.: Show and tell: a neural image caption generator. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 3156\u20133164 (2015)","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"937_CR34","doi-asserted-by":"crossref","unstructured":"Wang, Y., Liu, J., Wang, X.: Image caption with synchronous cross-attention. In: Proceedings of the on thematic workshops of ACM multimedia 2017, pp. 433\u2013441. ACM (2017)","DOI":"10.1145\/3126686.3126714"},{"key":"937_CR35","doi-asserted-by":"crossref","unstructured":"Wei, W., Cheng, L., Mao, X., Zhou, G., Zhu, F.: Stack-vs: Stacked visual-semantic attention for image caption generation. arXiv preprint arXiv:1909.02489 (2019)","DOI":"10.1109\/ACCESS.2020.3018752"},{"key":"937_CR36","doi-asserted-by":"publisher","first-page":"17","DOI":"10.1016\/j.neucom.2018.10.059","volume":"330","author":"A Yuan","year":"2019","unstructured":"Yuan, A., Li, X., Lu, X.: 3g structure for image caption generation. Neurocomputing 330, 17\u201328 (2019)","journal-title":"Neurocomputing"},{"key":"937_CR37","unstructured":"Zheng, J., Krishnamurthy, S., Chen, R., Chen, M.H., Ge, Z., Li, X.: Image captioning with integrated bottom-up and multi-level residual top-down attention for game scene understanding. arXiv preprint arXiv:1906.06632 (2019)"},{"key":"937_CR38","doi-asserted-by":"crossref","unstructured":"Zhou, L., Xu, C., Koch, P., Corso, J.J.: Watch what you just said: image captioning with text-conditional attention. In: Proceedings of the on thematic workshops of ACM multimedia 2017, pp. 305\u2013313. ACM (2017)","DOI":"10.1145\/3126686.3126717"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-022-00937-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-022-00937-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-022-00937-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,5,30]],"date-time":"2023-05-30T14:08:14Z","timestamp":1685455694000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-022-00937-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,5,9]]},"references-count":38,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2023,6]]}},"alternative-id":["937"],"URL":"https:\/\/doi.org\/10.1007\/s00530-022-00937-3","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,5,9]]},"assertion":[{"value":"22 August 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 February 2022","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 May 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}