{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,24]],"date-time":"2026-02-24T18:15:51Z","timestamp":1771956951292,"version":"3.50.1"},"reference-count":50,"publisher":"Springer Science and Business Media LLC","issue":"15","license":[{"start":{"date-parts":[[2022,3,15]],"date-time":"2022-03-15T00:00:00Z","timestamp":1647302400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,3,15]],"date-time":"2022-03-15T00:00:00Z","timestamp":1647302400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100012166","name":"national key r&d program of china","doi-asserted-by":"crossref","award":["2018YFB1305200"],"award-info":[{"award-number":["2018YFB1305200"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"national natural science foundation of china","doi-asserted-by":"publisher","award":["62020106004"],"award-info":[{"award-number":["62020106004"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"national natural science foundation of china","doi-asserted-by":"publisher","award":["92048301"],"award-info":[{"award-number":["92048301"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2022,6]]},"DOI":"10.1007\/s11042-022-12776-5","type":"journal-article","created":{"date-parts":[[2022,3,15]],"date-time":"2022-03-15T15:02:53Z","timestamp":1647356573000},"page":"21349-21367","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Semantic association enhancement transformer with relative position for image captioning"],"prefix":"10.1007","volume":"81","author":[{"given":"Xin","family":"Jia","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yunbo","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuxin","family":"Peng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6705-3831","authenticated-orcid":false,"given":"Shengyong","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,3,15]]},"reference":[{"key":"12776_CR1","doi-asserted-by":"crossref","unstructured":"Anderson P, Fernando B, Johnson M, Gould S (2016) Spice: semantic propositional image caption evaluation. In: European conference on computer vision (ECCV), pp 382\u2013398","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"12776_CR2","doi-asserted-by":"crossref","unstructured":"Anderson P, He X, Buehler C, Teney D, Johnson M, Gould S, Zhang L (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 6077\u20136086","DOI":"10.1109\/CVPR.2018.00636"},{"key":"12776_CR3","unstructured":"Ashish N, Vaswani S, Niki P, Jakob U, Llion J, Aidan NG, Lukasz K, Illia P (2017) Attention is all you need. In: Conference and workshop on neural information processing systems (NeurlPS), pp 5998\u20136008"},{"key":"12776_CR4","unstructured":"Banerjee S, Lavie A (2005) Meteor: an automatic metric for mt evaluation with improved correlation with human judgments. In: Annual meeting of the association for computational linguistics (ACL), pp 65\u201372"},{"issue":"3","key":"12776_CR5","doi-asserted-by":"publisher","first-page":"1147","DOI":"10.1007\/s11831-020-09409-1","volume":"28","author":"M Bansal","year":"2021","unstructured":"Bansal M, Kumar M, Kumar M (2021) 2d object recognition techniques: state-of-the-art work. Arch Comput Methods Eng 28(3):1147\u20131161","journal-title":"Arch Comput Methods Eng"},{"issue":"7","key":"12776_CR6","doi-asserted-by":"publisher","first-page":"2725","DOI":"10.1007\/s00521-018-3677-9","volume":"32","author":"P Chhabra","year":"2020","unstructured":"Chhabra P, Garg NK, Kumar M (2020) Content-based image retrieval system using orb and sift features. Neural Comput Applic 32(7):2725\u20132733","journal-title":"Neural Comput Applic"},{"key":"12776_CR7","doi-asserted-by":"crossref","unstructured":"Cornia M, Stefanini M, Baraldi L, Cucchiara R (2020) Meshed-memory transformer for image captioning. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 10575\u201310584","DOI":"10.1109\/CVPR42600.2020.01059"},{"key":"12776_CR8","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li L, Li K, Feifei L (2009) Imagenet: a large-scale hierarchical image database. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 248\u2013255","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"12776_CR9","unstructured":"Devlin J, Chang MW, Lee K, Toutanova K (2019) Bert: pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the conference of the North American chapter of the association for computational linguistics: human language technologies (NAACL-HLT), pp 4171\u20134186"},{"issue":"5","key":"12776_CR10","first-page":"1112","volume":"42","author":"L Gao","year":"2020","unstructured":"Gao L, Li X, Song J, Shen HT (2020) Hierarchical lstms with adaptive attention for visual captioning. IEEE Trans Pattern Anal Mach Intell 42 (5):1112\u20131131","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"8","key":"12776_CR11","doi-asserted-by":"publisher","first-page":"2149","DOI":"10.1109\/TMM.2019.2951226","volume":"22","author":"L Guo","year":"2020","unstructured":"Guo L, Liu J, Lu S, Lu H (2020) Show, tell, and polish: ruminant decoding for image captioning. IEEE Trans Multimodal (TMM) 22(8):2149\u20132162","journal-title":"IEEE Trans Multimodal (TMM)"},{"key":"12776_CR12","doi-asserted-by":"crossref","unstructured":"Guo L, Liu J, Zhu X, Yao P, Lu S, Lu H (2020) Normalized and geometry-aware self-attention network for image captioning. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 10324\u201310333","DOI":"10.1109\/CVPR42600.2020.01034"},{"key":"12776_CR13","unstructured":"Herdade S, Kappeler A, Boakye K, Soares J (2019) Image captioning: transforming objects into words. In: Conference and workshop on neural information processing systems (NeurlPS), pp 11135\u201311145"},{"key":"12776_CR14","doi-asserted-by":"crossref","unstructured":"Hu H, Gu J, Zhang Z, Dai J, Wei Y (2018) Relation networks for object detection. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 3588\u20133597","DOI":"10.1109\/CVPR.2018.00378"},{"key":"12776_CR15","unstructured":"Huang L, Wang W, Xia Y, Chen J (2019) Adaptively aligned image captioning via adaptive attention time. In: Conference and workshop on neural information processing systems (NeurlPS), pp 8942\u20138951"},{"key":"12776_CR16","doi-asserted-by":"publisher","first-page":"4013","DOI":"10.1109\/TIP.2020.2969330","volume":"29","author":"Y Huang","year":"2020","unstructured":"Huang Y, Chen J, Ouyang W, Wan W, Xue Y (2020) Image captioning with end-to-end attribute detection and subsequent attributes prediction. IEEE Trans Image Process (TIP) 29:4013\u20134026","journal-title":"IEEE Trans Image Process (TIP)"},{"key":"12776_CR17","doi-asserted-by":"publisher","first-page":"7615","DOI":"10.1109\/TIP.2020.3004729","volume":"29","author":"J Ji","year":"2020","unstructured":"Ji J, Xu C, Zhang X, Wang B, Song X (2020) Spatio-temporal memory attention for image captioning. IEEE Trans Image Process (TIP) 29:7615\u20137628","journal-title":"IEEE Trans Image Process (TIP)"},{"key":"12776_CR18","doi-asserted-by":"crossref","unstructured":"Jiang W, Ma L, Jiang Y, Liu W, Zhang T (2018) Recurrent fusion network for image captioning. In: European conference on computer vision (ECCV), pp 510\u2013526","DOI":"10.1007\/978-3-030-01216-8_31"},{"issue":"1","key":"12776_CR19","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O, Johnson J, Hata K, Kravitz J, Chen S, Kalantidis Y, Li L, Shamma DA, Bernstein MS, Li F (2017) Visual genome: connecting language and vision using crowdsourced dense image annotations. Int J Comput Vis (IJCV) 123(1):32\u201373","journal-title":"Int J Comput Vis (IJCV)"},{"issue":"16","key":"12776_CR20","doi-asserted-by":"publisher","first-page":"21557","DOI":"10.1007\/s11042-017-5587-8","volume":"77","author":"M Kumar","year":"2018","unstructured":"Kumar M, Chhabra P, Garg NK (2018) An efficient content based image retrieval system using bayesnet and k-nn. Multimed Tools Appl 77(16):21557\u201321570","journal-title":"Multimed Tools Appl"},{"key":"12776_CR21","doi-asserted-by":"crossref","unstructured":"Kumar M, Kumar M, et al. (2021) Xgboost: 2d-object recognition using shape descriptors and extreme gradient boosting classifier. In: International conference on computational methods and data engineering (ICCMDE), pp 207\u2013222","DOI":"10.1007\/978-981-15-6876-3_16"},{"key":"12776_CR22","doi-asserted-by":"crossref","unstructured":"Li G, Zhu L, Liu P, Yang Y (2019) Entangled transformer for image captioning. In: IEEE International conference on computer vision (ICCV), pp 8928\u20138937","DOI":"10.1109\/ICCV.2019.00902"},{"issue":"16","key":"12776_CR23","doi-asserted-by":"publisher","first-page":"3260","DOI":"10.3390\/app9163260","volume":"9","author":"J Li","year":"2019","unstructured":"Li J, Yao P, Guo L, Zhang W (2019) Boosted transformer for image captioning. Appl Sci 9(16):3260","journal-title":"Appl Sci"},{"key":"12776_CR24","unstructured":"Lin C (2004) Rouge: a package for automatic evaluation of summaries. In: Annual meeting of the association for computational linguistics (ACL), pp 74\u201381"},{"key":"12776_CR25","doi-asserted-by":"crossref","unstructured":"Lin T, Maire M, Belongie S, Hays J, Perona P, Ramanan D, Dollar P, Zitnick CL (2014) Microsoft coco: Common objects in context. In: European conference on computer vision (ECCV), pp 740\u2013755","DOI":"10.1007\/978-3-319-10602-1_48"},{"issue":"33","key":"12776_CR26","first-page":"24429","volume":"79","author":"N Naqvi","year":"2021","unstructured":"Naqvi N, Ye Z (2021) Image captions: global-local and joint signals attention model (gl-jsam). Multimed Tools Appl 79(33):24429\u201324448","journal-title":"Multimed Tools Appl"},{"key":"12776_CR27","doi-asserted-by":"crossref","unstructured":"Papineni K, Roukos S, Ward T, Zhu W (2002) Bleu: a method for automatic evaluation of machine translation. In: Annual meeting of the association for computational linguistics (ACL), pp 311\u2013318","DOI":"10.3115\/1073083.1073135"},{"key":"12776_CR28","doi-asserted-by":"crossref","unstructured":"Qin Y, Du J, Zhang Y, Lu H (2019) Look back and predict forward in image captioning. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 8367\u20138375","DOI":"10.1109\/CVPR.2019.00856"},{"key":"12776_CR29","unstructured":"Ren S, He K, Girshick R, Sun J (2015) Faster r-cnn: towards real-time object detection with region proposal networks. In: Conference and workshop on neural information processing systems (NeurlPS), pp 91\u201399"},{"key":"12776_CR30","doi-asserted-by":"crossref","unstructured":"Rennie SJ, Marcheret E, Mroueh Y, Ross J, Goel V (2017) Self-critical sequence training for image captioning. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 1179\u20131195","DOI":"10.1109\/CVPR.2017.131"},{"key":"12776_CR31","unstructured":"Ryan K, Ruslan S, Richard SZ (2014) Unifying visual-semantic embeddings with multimodal neural language models. In: arXiv:1411.253"},{"issue":"35","key":"12776_CR32","doi-asserted-by":"publisher","first-page":"26661","DOI":"10.1007\/s11042-020-09294-7","volume":"79","author":"X Shen","year":"2020","unstructured":"Shen X, Liu B, Zhou Y, Zhao J (2020) Remote sensing image caption generation via transformer and reinforcement learning. Multimed Tools Appl 79(35):26661\u201326682","journal-title":"Multimed Tools Appl"},{"key":"12776_CR33","doi-asserted-by":"crossref","unstructured":"Shi Z, Zhou X, Qiu X, Zhu X (2020) Improving image captioning with better use of captions. In: Annual meeting of the association for computational linguistics (ACL), pp 7454\u20137464","DOI":"10.18653\/v1\/2020.acl-main.664"},{"key":"12776_CR34","doi-asserted-by":"crossref","unstructured":"Tran A, Mathews A, Xie L (2020) Transform and tell: entity-aware news image captioning. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 13032\u201313042","DOI":"10.1109\/CVPR42600.2020.01305"},{"key":"12776_CR35","doi-asserted-by":"crossref","unstructured":"Vedantam R, Zitnick CL, Parikh D (2015) Cider: consensus-based image description evaluation. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 4566\u20134575","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"12776_CR36","doi-asserted-by":"crossref","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2015) Show and tell: a neural image caption generator. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 3156\u20133164","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"12776_CR37","doi-asserted-by":"crossref","unstructured":"Wang L, Bai Z, Zhang Y, Lu H (2020) Show, recall, and tell: image captioning with recall mechanism. In: AAAI Conference on artificial intelligence (AAAI), pp 12176\u201312183","DOI":"10.1609\/aaai.v34i07.6898"},{"issue":"17","key":"12776_CR38","doi-asserted-by":"publisher","first-page":"11531","DOI":"10.1007\/s11042-019-08567-0","volume":"79","author":"S Wang","year":"2020","unstructured":"Wang S, Lan L, Zhang X, Luo Z (2020) Gatecap: gated spatial and semantic attention model for image captioning. Multimed Tools Appl 79 (17):11531\u201311549","journal-title":"Multimed Tools Appl"},{"issue":"3","key":"12776_CR39","doi-asserted-by":"publisher","first-page":"1042","DOI":"10.1109\/TCSVT.2020.2991866","volume":"31","author":"Z Wen","year":"2020","unstructured":"Wen Z, Peng Y (2020) Multi-level knowledge injecting for visual commonsense reasoning. IEEE Trans Circ Syst Vid Technol (TCSVT) 31(3):1042\u20131054","journal-title":"IEEE Trans Circ Syst Vid Technol (TCSVT)"},{"key":"12776_CR40","doi-asserted-by":"publisher","unstructured":"Wu J, Chen T, Wu H, Yang Z, Luo G, Lin L (2020) Fine-grained image captioning with global-local discriminative objective. IEEE Transactions on Multimedia (TMM). https:\/\/doi.org\/10.1109\/TMM.2020.3011317","DOI":"10.1109\/TMM.2020.3011317"},{"key":"12776_CR41","doi-asserted-by":"publisher","unstructured":"Wu L, Xu M, Sang L, Yao T, Mei T (2020) Noise augmented double-stream graph convolutional networks for image captioning. IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). https:\/\/doi.org\/10.1109\/TCSVT.2020.3036860","DOI":"10.1109\/TCSVT.2020.3036860"},{"key":"12776_CR42","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhutdinov R, Zemel R, Bengio Y (2015) Show, attend and tell: neural image caption generation with visual attention. In: International conference on machine learning (ICML), pp 2048\u20132057"},{"key":"12776_CR43","doi-asserted-by":"publisher","unstructured":"Yan C, Hao Y, Li L, Yin J, Liu A, Mao Z, Chen Z, Gao X (2021) Task-adaptive attention for image captioning. IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). https:\/\/doi.org\/10.1109\/TCSVT.2021.3067449","DOI":"10.1109\/TCSVT.2021.3067449"},{"key":"12776_CR44","doi-asserted-by":"publisher","first-page":"835","DOI":"10.1109\/TMM.2020.2990074","volume":"23","author":"L Yang","year":"2021","unstructured":"Yang L, Wang H, Tang P, Li Q (2021) Captionnet: a tailor-made recurrent neural network for generating image descriptions. IEEE Trans Multimed (TMM) 23:835\u2013845","journal-title":"IEEE Trans Multimed (TMM)"},{"key":"12776_CR45","doi-asserted-by":"crossref","unstructured":"Yang X, Tang K, Zhang H, Cai J (2019) Auto-encoding scene graphs for image captioning. In: IEEE Conference on computer vision and pattern recognition (CVPR), pp 10685\u201310694","DOI":"10.1109\/CVPR.2019.01094"},{"key":"12776_CR46","doi-asserted-by":"crossref","unstructured":"Yao T, Pan Y, Li Y, Mei T (2018) Exploring visual relationship for image captioning. In: European conference on computer vision (ECCV), pp 711\u2013727","DOI":"10.1007\/978-3-030-01264-9_42"},{"key":"12776_CR47","doi-asserted-by":"crossref","unstructured":"Yao T, Pan Y, Li Y, Mei T (2019) Hierarchy parsing for image captioning. In: IEEE International conference on computer vision (ICCV), pp 2621\u20132629","DOI":"10.1109\/ICCV.2019.00271"},{"issue":"12","key":"12776_CR48","doi-asserted-by":"publisher","first-page":"4467","DOI":"10.1109\/TCSVT.2019.2947482","volume":"30","author":"J Yu","year":"2020","unstructured":"Yu J, Li J, Yu Z, Huang Q (2020) Multimodal transformer with multi-view visual representation for image captioning. IEEE Trans Circ Syst Video Technol (TCSVT) 30(12):4467\u20134480","journal-title":"IEEE Trans Circ Syst Video Technol (TCSVT)"},{"key":"12776_CR49","doi-asserted-by":"publisher","first-page":"43","DOI":"10.1016\/j.patrec.2020.12.020","volume":"143","author":"Y Zhang","year":"2021","unstructured":"Zhang Y, Shi X, Mi S, Yang X (2021) Image captioning with transformer and knowledge graph. Pattern Recogn Lett (PRL) 143:43\u201349","journal-title":"Pattern Recogn Lett (PRL)"},{"key":"12776_CR50","first-page":"5","volume":"8","author":"X Zhu","year":"2018","unstructured":"Zhu X, Li L, Liu J, Peng H, Niu X (2018) Captioning transformer with stacked attention modules. Appl Sci 8:5","journal-title":"Appl Sci"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-022-12776-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-022-12776-5\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-022-12776-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,26]],"date-time":"2022-05-26T06:33:34Z","timestamp":1653546814000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-022-12776-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,3,15]]},"references-count":50,"journal-issue":{"issue":"15","published-print":{"date-parts":[[2022,6]]}},"alternative-id":["12776"],"URL":"https:\/\/doi.org\/10.1007\/s11042-022-12776-5","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,3,15]]},"assertion":[{"value":"22 July 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 December 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 February 2022","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 March 2022","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"<!--Emphasis Type='Bold' removed-->Conflict of Interests"}}]}}