{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,11]],"date-time":"2026-05-11T18:04:12Z","timestamp":1778522652146,"version":"3.51.4"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2025,1,29]],"date-time":"2025-01-29T00:00:00Z","timestamp":1738108800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,29]],"date-time":"2025-01-29T00:00:00Z","timestamp":1738108800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2025,8]]},"DOI":"10.1007\/s00371-024-03790-9","type":"journal-article","created":{"date-parts":[[2025,1,29]],"date-time":"2025-01-29T13:23:24Z","timestamp":1738157004000},"page":"7027-7047","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Enriching image description generation through multi-modal fusion of VGG16, scene graphs and BiGRU"],"prefix":"10.1007","volume":"41","author":[{"given":"Lakshita","family":"Agarwal","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bindu","family":"Verma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,1,29]]},"reference":[{"key":"3790_CR1","doi-asserted-by":"crossref","unstructured":"Kanimozhiselvi, C., Karthika, V., Kalaivani, S., Krithika, S.: Image captioning using deep learning. In: 2022 International Conference on Computer Communication and Informatics (ICCCI), pp. 1\u20137. IEEE (2022)","DOI":"10.1109\/ICCCI54379.2022.9740788"},{"key":"3790_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11042-023-16560-x","volume":"83","author":"L Agarwal","year":"2023","unstructured":"Agarwal, L., Verma, B.: From methods to datasets: a survey on image-caption generators. Multimed. Tools Appl. 83, 1\u201347 (2023)","journal-title":"Multimed. Tools Appl."},{"key":"3790_CR3","doi-asserted-by":"crossref","unstructured":"Siarohin, A., Lathuili\u00e8re, S., Tulyakov, S., Ricci, E., Sebe, N.: Animating arbitrary objects via deep motion transfer. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2377\u20132386 (2019)","DOI":"10.1109\/CVPR.2019.00248"},{"key":"3790_CR4","doi-asserted-by":"crossref","unstructured":"Vogt, D., Grehl, S., Berger, E., Ben\u00a0Amor, H., Jung, B.: A data-driven method for real-time character animation in human-agent interaction. In: Intelligent Virtual Agents: 14th International Conference, IVA 2014, Boston, MA, USA, August 27\u201329, 2014. Proceedings 14, pp. 463\u2013476. Springer (2014)","DOI":"10.1007\/978-3-319-09767-1_57"},{"key":"3790_CR5","doi-asserted-by":"crossref","unstructured":"Cannav\u00f2, A., Zhang, C., Wang, W., Lamberti, F.: Posing 3d characters in virtual reality through in-the-air sketches. In: International Conference on Computer Animation and Social Agents, pp. 51\u201361. Springer (2020)","DOI":"10.1007\/978-3-030-63426-1_6"},{"key":"3790_CR6","doi-asserted-by":"crossref","unstructured":"Li, J.: Augmented reality visual-captions: enhancing captioning experience for real-time conversations. In: International Conference on Human-Computer Interaction, pp. 380\u2013396. Springer (2023)","DOI":"10.1007\/978-3-031-34609-5_28"},{"key":"3790_CR7","doi-asserted-by":"crossref","unstructured":"Chen, N., Lu, Z., Yu, X., Yang, L., Xu, P., Fan, Y.: Augmented reality-based home interaction layout and evaluation. In: Computer Graphics International Conference, pp. 395\u2013406. Springer (2022)","DOI":"10.1007\/978-3-031-23473-6_31"},{"issue":"3","key":"3790_CR8","doi-asserted-by":"publisher","first-page":"808","DOI":"10.1109\/TMM.2019.2931815","volume":"22","author":"L Wu","year":"2019","unstructured":"Wu, L., Xu, M., Wang, J., Perry, S.: Recall what you see continually using gridlstm in image captioning. IEEE Trans. Multimed. 22(3), 808\u2013818 (2019)","journal-title":"IEEE Trans. Multimed."},{"key":"3790_CR9","unstructured":"Mozes, M., Schmitt, M., Golkov, V., Sch\u00fctze, H., Cremers, D.: Scene graph generation for better image captioning? arXiv e-print arXiv:2109.11398 (2021)"},{"issue":"5","key":"3790_CR10","first-page":"2313","volume":"44","author":"X Yang","year":"2020","unstructured":"Yang, X., Zhang, H., Cai, J.: Auto-encoding and distilling scene graphs for image captioning. IEEE Trans. Pattern Anal. Mach. Intell. 44(5), 2313\u20132327 (2020)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3790_CR11","doi-asserted-by":"crossref","unstructured":"Yu, C., Liang, J., Liao, Y., Xie, Z., Sheng, B.: Graph adversarial network with bottleneck adapter tuning for sign language production. In: Computer Graphics International Conference, pp. 92\u2013103. Springer (2022)","DOI":"10.1007\/978-3-031-23473-6_8"},{"issue":"15","key":"3790_CR12","doi-asserted-by":"publisher","first-page":"7724","DOI":"10.3390\/app12157724","volume":"12","author":"M Al Duhayyim","year":"2022","unstructured":"Al Duhayyim, M., Alazwari, S., Mengash, H.A., Marzouk, R., Alzahrani, J.S., Mahgoub, H., Althukair, F., Salama, A.S.: Metaheuristics optimization with deep learning enabled automated image captioning system. Appl. Sci. 12(15), 7724 (2022)","journal-title":"Appl. Sci."},{"issue":"1","key":"3790_CR13","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TPAMI.2021.3137605","volume":"45","author":"X Chang","year":"2021","unstructured":"Chang, X., Ren, P., Xu, P., Li, Z., Chen, X., Hauptmann, A.: A comprehensive survey of scene graphs: generation and application. IEEE Trans. Pattern Anal. Mach. Intell. 45(1), 1\u201326 (2021)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3790_CR14","doi-asserted-by":"publisher","first-page":"50","DOI":"10.1109\/TMM.2021.3120873","volume":"25","author":"X Lin","year":"2021","unstructured":"Lin, X., Sun, S., Huang, W., Sheng, B., Li, P., Feng, D.D.: Eapt: efficient attention pyramid transformer for image processing. IEEE Trans. Multimed. 25, 50\u201361 (2021)","journal-title":"IEEE Trans. Multimed."},{"key":"3790_CR15","first-page":"13489","volume":"45","author":"Z Chen","year":"2023","unstructured":"Chen, Z., Qiu, G., Li, P., Zhu, L., Yang, X., Sheng, B.: Mngnas: distilling adaptive combination of multiple searched networks for one-shot neural architecture search. IEEE Trans. Pattern Anal. Mach. Intell. 45, 13489 (2023)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"7","key":"3790_CR16","doi-asserted-by":"publisher","first-page":"6662","DOI":"10.1109\/TCYB.2021.3079311","volume":"52","author":"B Sheng","year":"2021","unstructured":"Sheng, B., Li, P., Ali, R., Chen, C.P.: Improving video temporal consistency via broad learning system. IEEE Trans. Cybern. 52(7), 6662\u20136675 (2021)","journal-title":"IEEE Trans. Cybern."},{"issue":"1","key":"3790_CR17","doi-asserted-by":"publisher","first-page":"163","DOI":"10.1109\/TII.2021.3085669","volume":"18","author":"J Li","year":"2021","unstructured":"Li, J., Chen, J., Sheng, B., Li, P., Yang, P., Feng, D.D., Qi, J.: Automatic detection and classification system of domestic waste via multimodel cascaded convolutional neural network. IEEE Trans. Ind. Inform. 18(1), 163\u2013173 (2021)","journal-title":"IEEE Trans. Ind. Inform."},{"key":"3790_CR18","doi-asserted-by":"publisher","first-page":"4499","DOI":"10.1109\/TNNLS.2021.3116209","volume":"34","author":"Z Xie","year":"2021","unstructured":"Xie, Z., Zhang, W., Sheng, B., Li, P., Chen, C.P.: Bagfn: broad attentive graph fusion network for high-order feature interactions. IEEE Trans. Neural Netw. Learn. Syst. 34, 4499 (2021)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"3790_CR19","doi-asserted-by":"publisher","first-page":"2226","DOI":"10.1109\/TMM.2022.3144890","volume":"25","author":"N Jiang","year":"2022","unstructured":"Jiang, N., Sheng, B., Li, P., Lee, T.-Y.: Photohelper: portrait photographing guidance via deep feature retrieval and fusion. IEEE Trans. Multimed. 25, 2226 (2022)","journal-title":"IEEE Trans. Multimed."},{"key":"3790_CR20","unstructured":"Stefanini, M., Cornia, M., Baraldi, L., Cascianelli, S., Fiameni, G., Cucchiara, R.: From show to tell: a survey on image captioning. arXiv e-prints, 2107 (2021)"},{"key":"3790_CR21","doi-asserted-by":"crossref","unstructured":"Jeon, J., Lavrenko, V., Manmatha, R.: Automatic image annotation and retrieval using cross-media relevance models. In: Proceedings of the 26th Annual International ACM SIGIR Conference on Research and Development in Informaion Retrieval, pp. 119\u2013126 (2003)","DOI":"10.1145\/860435.860459"},{"issue":"9","key":"3790_CR22","doi-asserted-by":"publisher","first-page":"1075","DOI":"10.1109\/TPAMI.2003.1227984","volume":"25","author":"J Li","year":"2003","unstructured":"Li, J., Wang, J.Z.: Automatic linguistic indexing of pictures by a statistical modeling approach. IEEE Trans. Pattern Anal. Mach. Intell. 25(9), 1075\u20131088 (2003)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3790_CR23","unstructured":"Pan, J.-Y., Yang, H.-J., Duygulu, P., Faloutsos, C.: Automatic image captioning. In: 2004 IEEE International Conference on Multimedia and Expo (ICME)(IEEE Cat. No. 04TH8763), vol. 3, pp. 1987\u20131990. IEEE (2004)"},{"key":"3790_CR24","doi-asserted-by":"crossref","unstructured":"Tan, Y.H., Chan, C.S.: phi-lstm: a phrase-based hierarchical lstm model for image captioning. In: Asian Conference on Computer Vision, pp. 101\u2013117. Springer (2016)","DOI":"10.1007\/978-3-319-54193-8_7"},{"key":"3790_CR25","unstructured":"Xu, K., Ba, J., Kiros, R., Cho, K., Courville, A., Salakhudinov, R., Zemel, R., Bengio, Y.: Show, attend and tell: neural image caption generation with visual attention. In: International Conference on Machine Learning, pp. 2048\u20132057. PMLR (2015)"},{"issue":"3\u20134","key":"3790_CR26","doi-asserted-by":"publisher","first-page":"2072","DOI":"10.1002\/cav.2072","volume":"33","author":"J Dai","year":"2022","unstructured":"Dai, J., Zhang, X.: Automatic image caption generation using deep learning and multimodal attention. Comput. Animat. Virtual Worlds 33(3\u20134), 2072 (2022)","journal-title":"Comput. Animat. Virtual Worlds"},{"key":"3790_CR27","unstructured":"Chen, X., Zitnick, C.L.: Learning a recurrent visual representation for image caption generation. arXiv e-prints, 1411 (2014)"},{"key":"3790_CR28","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1016\/j.patrec.2019.03.021","volume":"123","author":"S Ding","year":"2019","unstructured":"Ding, S., Qu, S., Xi, Y., Sangaiah, A.K., Wan, S.: Image caption generation with high-level image features. Pattern Recogn. Lett. 123, 89\u201395 (2019)","journal-title":"Pattern Recogn. Lett."},{"key":"3790_CR29","doi-asserted-by":"crossref","unstructured":"Yucong, Q., Li, M.: Image caption based on bigru and attention hybrid model. In: Proceedings of the 2021 4th International Conference on Artificial Intelligence and Pattern Recognition, pp. 128\u2013136 (2021)","DOI":"10.1145\/3488933.3488978"},{"key":"3790_CR30","first-page":"1","volume":"40","author":"K Qian","year":"2023","unstructured":"Qian, K., Pan, Y., Xu, H., Tian, L.: Transformer model incorporating local graph semantic attention for image caption. Visual Comput. 40, 1\u201312 (2023)","journal-title":"Visual Comput."},{"issue":"5","key":"3790_CR31","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3638558","volume":"20","author":"J Li","year":"2024","unstructured":"Li, J., Mao, Z., Li, H., Chen, W., Zhang, Y.: Exploring visual relationships via transformer-based graphs for enhanced image captioning. ACM Trans. Multimed. Comput. Commun. Appl. 20(5), 1\u201323 (2024)","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"issue":"1","key":"3790_CR32","first-page":"1","volume":"19","author":"Y Zhang","year":"2023","unstructured":"Zhang, Y., Pan, Y., Yao, T., Huang, R., Mei, T., Chen, C.-W.: Boosting scene graph generation with visual relation saliency. ACM Trans. Multimed. Comput. Commun. Appl. 19(1), 1\u201317 (2023)","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"key":"3790_CR33","doi-asserted-by":"crossref","unstructured":"Li, Y., Ouyang, W., Zhou, B., Wang, K., Wang, X.: Scene graph generation from objects, phrases and region captions. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 1261\u20131270 (2017)","DOI":"10.1109\/ICCV.2017.142"},{"key":"3790_CR34","doi-asserted-by":"publisher","first-page":"477","DOI":"10.1016\/j.jvcir.2018.12.027","volume":"58","author":"N Xu","year":"2019","unstructured":"Xu, N., Liu, A.-A., Liu, J., Nie, W., Su, Y.: Scene graph captioner: image captioning based on structural visual representation. J. Visual Commun. Image Represent. 58, 477\u2013485 (2019)","journal-title":"J. Visual Commun. Image Represent."},{"key":"3790_CR35","doi-asserted-by":"crossref","unstructured":"Yang, X., Tang, K., Zhang, H., Cai, J.: Auto-encoding scene graphs for image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10685\u201310694 (2019)","DOI":"10.1109\/CVPR.2019.01094"},{"key":"3790_CR36","doi-asserted-by":"publisher","DOI":"10.1016\/j.displa.2022.102210","volume":"74","author":"S Zhao","year":"2022","unstructured":"Zhao, S., Li, L., Peng, H.: Aligned visual semantic scene graph for image captioning. Displays 74, 102210 (2022)","journal-title":"Displays"},{"key":"3790_CR37","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2022.104591","volume":"129","author":"Z Li","year":"2023","unstructured":"Li, Z., Wei, J., Huang, F., Ma, H.: Modeling graph-structured contexts for image captioning. Image Vis. Comput. 129, 104591 (2023)","journal-title":"Image Vis. Comput."},{"issue":"12","key":"3790_CR38","doi-asserted-by":"publisher","first-page":"2681","DOI":"10.3390\/sym14122681","volume":"14","author":"S Ayoub","year":"2022","unstructured":"Ayoub, S., Gulzar, Y., Reegu, F.A., Turaev, S.: Generating image captions using Bahdanau attention mechanism and transfer learning. Symmetry 14(12), 2681 (2022)","journal-title":"Symmetry"},{"key":"3790_CR39","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Fei-Fei, L.: Deep visual-semantic alignments for generating image descriptions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3128\u20133137 (2015)","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"3790_CR40","doi-asserted-by":"crossref","unstructured":"Yao, T., Pan, Y., Li, Y., Qiu, Z., Mei, T.: Boosting image captioning with attributes. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4894\u20134902 (2017)","DOI":"10.1109\/ICCV.2017.524"},{"key":"3790_CR41","doi-asserted-by":"crossref","unstructured":"Yao, T., Pan, Y., Li, Y., Mei, T.: Exploring visual relationship for image captioning. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 684\u2013699 (2018)","DOI":"10.1007\/978-3-030-01264-9_42"},{"key":"3790_CR42","doi-asserted-by":"crossref","unstructured":"Shi, Z., Zhou, X., Qiu, X., Zhu, X.: Improving image captioning with better use of captions. arXiv e-print arXiv:2006.11807 (2020)","DOI":"10.18653\/v1\/2020.acl-main.664"},{"issue":"8","key":"3790_CR43","doi-asserted-by":"publisher","first-page":"2149","DOI":"10.1109\/TMM.2019.2951226","volume":"22","author":"L Guo","year":"2019","unstructured":"Guo, L., Liu, J., Lu, S., Lu, H.: Show, tell, and polish: Ruminant decoding for image captioning. IEEE Trans. Multimed. 22(8), 2149\u20132162 (2019)","journal-title":"IEEE Trans. Multimed."},{"key":"3790_CR44","doi-asserted-by":"crossref","unstructured":"Cornia, M., Stefanini, M., Baraldi, L., Cucchiara, R.: Meshed-memory transformer for image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10578\u201310587 (2020)","DOI":"10.1109\/CVPR42600.2020.01059"},{"key":"3790_CR45","doi-asserted-by":"crossref","unstructured":"Vinyals, O., Toshev, A., Bengio, S., Erhan, D.: Show and tell: a neural image caption generator. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3156\u20133164 (2015)","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"3790_CR46","doi-asserted-by":"crossref","unstructured":"Jia, X., Gavves, E., Fernando, B., Tuytelaars, T.: Guiding the long-short term memory model for image caption generation. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2407\u20132415 (2015)","DOI":"10.1109\/ICCV.2015.277"},{"key":"3790_CR47","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2021.115462","volume":"184","author":"J Zhang","year":"2021","unstructured":"Zhang, J., Li, K., Wang, Z., Zhao, X., Wang, Z.: Visual enhanced gLSTM for image captioning. Expert Syst. Appl. 184, 115462 (2021)","journal-title":"Expert Syst. Appl."},{"key":"3790_CR48","doi-asserted-by":"crossref","unstructured":"Lu, J., Xiong, C., Parikh, D., Socher, R.: Knowing when to look: adaptive attention via a visual sentinel for image captioning. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 375\u2013383 (2017)","DOI":"10.1109\/CVPR.2017.345"},{"issue":"6","key":"3790_CR49","doi-asserted-by":"publisher","first-page":"2743","DOI":"10.1109\/TIP.2018.2889922","volume":"28","author":"N Yu","year":"2018","unstructured":"Yu, N., Hu, X., Song, B., Yang, J., Zhang, J.: Topic-oriented image captioning based on order-embedding. IEEE Transactions on Image Processing 28(6), 2743\u20132754 (2018)","journal-title":"IEEE Transactions on Image Processing"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-024-03790-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-024-03790-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-024-03790-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,6]],"date-time":"2025-09-06T04:28:22Z","timestamp":1757132902000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-024-03790-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,29]]},"references-count":49,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2025,8]]}},"alternative-id":["3790"],"URL":"https:\/\/doi.org\/10.1007\/s00371-024-03790-9","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,29]]},"assertion":[{"value":"29 December 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 January 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}