{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,8]],"date-time":"2026-02-08T03:43:15Z","timestamp":1770522195496,"version":"3.49.0"},"reference-count":40,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2023,9,14]],"date-time":"2023-09-14T00:00:00Z","timestamp":1694649600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,9,14]],"date-time":"2023-09-14T00:00:00Z","timestamp":1694649600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-023-16687-x","type":"journal-article","created":{"date-parts":[[2023,9,14]],"date-time":"2023-09-14T13:50:52Z","timestamp":1694699452000},"page":"29997-30017","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Combining semi-supervised model and optimized LSTM for image caption generation based on pseudo labels"],"prefix":"10.1007","volume":"83","author":[{"given":"Roshni","family":"Padate","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Amit","family":"Jain","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mukesh","family":"Kalla","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Arvind","family":"Sharma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,9,14]]},"reference":[{"key":"16687_CR1","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1007\/s42979-020-00238-4","volume":"1","author":"C Sur","year":"2020","unstructured":"Sur C (2020) AACR: Feature Fusion Effects of Algebraic Amalgamation Composed Representation on (De)Compositional Network for Caption Generation for Images. SN COMPUT SCI 1:229. https:\/\/doi.org\/10.1007\/s42979-020-00238-4","journal-title":"SN COMPUT SCI"},{"issue":"Cover date: 5 D","key":"16687_CR2","doi-asserted-by":"publisher","first-page":"419","DOI":"10.1016\/j.neucom.2020.08.019","volume":"417","author":"S Cao","year":"2020","unstructured":"Cao S, An G, Zheng Z, Ruan Q (2020) Interactions Guided Generative Adversarial Network for unsupervised image captioning. Neurocomputing 417(Cover date: 5 December 2020):419\u2013431","journal-title":"Neurocomputing"},{"key":"16687_CR3","doi-asserted-by":"crossref","unstructured":"Wei Y, Wang L, Cao H, Shao M, Wu C (2019) Multi-Attention Generative Adversarial Network for image captioning. Neurocomputing, 387 (Cover date: 28 April 2020), pp. 91\u201399","DOI":"10.1016\/j.neucom.2019.12.073"},{"key":"16687_CR4","doi-asserted-by":"publisher","first-page":"40","DOI":"10.1016\/j.jvcir.2018.05.008","volume":"55","author":"C Fan","year":"2018","unstructured":"Fan C, Zhang Z, Crandall DJ (2018) Deepdiary: Lifelogging image captioning and summarization. J Vis Commun Image Represent 55:40\u201355","journal-title":"J Vis Commun Image Represent"},{"key":"16687_CR5","doi-asserted-by":"crossref","unstructured":"Padate R, Jain A, Kalla M, Sharma A, 2022. High-level and low-level feature set for image caption generation with optimized convolutional neural network. Journal of Telecommunications and Information Technology.","DOI":"10.26636\/jtit.2022.164222"},{"key":"16687_CR6","doi-asserted-by":"crossref","unstructured":"Padate R, Jain A, Kalla M, Sharma A (2022). A Widespread Assessment and Open Issues on Image Captioning Models. International Journal of Image and Graphics, 2350057","DOI":"10.1142\/S0219467823500572"},{"key":"16687_CR7","doi-asserted-by":"publisher","first-page":"106112","DOI":"10.1016\/j.engappai.2023.106112","volume":"123","author":"R Padate","year":"2023","unstructured":"Padate R, Jain A, Kalla M, Sharma A (2023) Image caption generation using a dual attention mechanism. Eng Appl Artif Intell 123:106112","journal-title":"Eng Appl Artif Intell"},{"key":"16687_CR8","doi-asserted-by":"publisher","first-page":"9627","DOI":"10.1109\/TIP.2020.3028651","volume":"29","author":"M Yang","year":"2020","unstructured":"Yang M et al (2020) An Ensemble of Generation- and Retrieval-Based Image Captioning With Dual Generator Generative Adversarial Network. IEEE Trans Image Process 29:9627\u20139640. https:\/\/doi.org\/10.1109\/TIP.2020.3028651","journal-title":"IEEE Trans Image Process"},{"key":"16687_CR9","doi-asserted-by":"publisher","first-page":"476","DOI":"10.1016\/j.neucom.2018.11.004","volume":"329","author":"D Zhao","year":"2019","unstructured":"Zhao D, Chang Z, Guo S (2019) A multimodal fusion approach for image captioning. Neurocomputing 329:476\u2013485","journal-title":"Neurocomputing"},{"key":"16687_CR10","doi-asserted-by":"crossref","unstructured":"Deng Z, Jiang Z, Lan R, Huang W, Luo X (2020) Image captioning using DenseNet network and adaptive attention. Signal Processing: Image Communication, Volume 85, Article 115836","DOI":"10.1016\/j.image.2020.115836"},{"issue":"20","key":"16687_CR11","first-page":"144","volume":"367","author":"S Jinsong","year":"2019","unstructured":"Jinsong S, Tang J, Ziyao L, Han X, Zhang H (2019) A neural image captioning model with caption-to-images semantic constructor. Neurocomputing 367(20):144\u2013151","journal-title":"Neurocomputing"},{"key":"16687_CR12","doi-asserted-by":"crossref","unstructured":"Bang S, Kim H (2020) \"Context-based information generation for managing UAV-acquired data using image captioning\" Automation in Construction, Volume 112, Article 103116","DOI":"10.1016\/j.autcon.2020.103116"},{"issue":"11","key":"16687_CR13","doi-asserted-by":"publisher","first-page":"249","DOI":"10.1016\/j.neucom.2020.03.087","volume":"401","author":"H Wang","year":"2020","unstructured":"Wang H, Wang H, Kaisheng X (2020) Evolutionary recurrent neural network for image captioning. Neurocomputing 401(11):249\u2013256","journal-title":"Neurocomputing"},{"issue":"5","key":"16687_CR14","doi-asserted-by":"publisher","first-page":"92","DOI":"10.1016\/j.neucom.2020.02.041","volume":"396","author":"R Li","year":"2020","unstructured":"Li R, Liang H, Shi Y, Feng F, Wang X (2020) Dual-CNN: A Convolutional language decoder for paragraph image captioning. Neurocomputing 396(5):92\u2013101","journal-title":"Neurocomputing"},{"key":"16687_CR15","doi-asserted-by":"publisher","first-page":"141","DOI":"10.1016\/j.image.2018.02.005","volume":"63","author":"J Guan","year":"2018","unstructured":"Guan J, Wang E (2018) Repeated review based image captioning for image evidence review. Signal Process Image Commun 63:141\u2013148","journal-title":"Signal Process Image Commun"},{"key":"16687_CR16","doi-asserted-by":"publisher","first-page":"416","DOI":"10.1016\/j.neucom.2017.07.014","volume":"272","author":"P Kinghorn","year":"2018","unstructured":"Kinghorn P, Zhang L, Shao L (2018) A region-based image caption generator with refined descriptions. Neurocomputing 272:416\u2013424","journal-title":"Neurocomputing"},{"key":"16687_CR17","doi-asserted-by":"publisher","first-page":"47","DOI":"10.1016\/j.compind.2018.01.015","volume":"97","author":"Q Liu","year":"2018","unstructured":"Liu Q, Chen Y, Wang J, Zhang S (2018) Multi-view pedestrian captioning with an attention topic CNN model. Comput Ind 97:47\u201353","journal-title":"Comput Ind"},{"key":"16687_CR18","doi-asserted-by":"publisher","first-page":"101","DOI":"10.1016\/j.cviu.2017.09.001","volume":"163","author":"G Christie","year":"2017","unstructured":"Christie G, Laddha A, Agrawal A, Antol S, Batra D (2017) Resolving vision and language ambiguities together: Joint segmentation & prepositional attachment resolution in captioned scenes. Comput Vis Image Underst 163:101\u2013112","journal-title":"Comput Vis Image Underst"},{"issue":"1","key":"16687_CR19","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1109\/TR.2022.3162346","volume":"72","author":"S Liu","year":"2023","unstructured":"Liu S, Xu X, Zhang Y, Muhammad K, Fu W (2023) A Reliable Sample Selection Strategy for Weakly Supervised Visual Tracking. In: IEEE Trans Reliab 72(1):15\u201326. https:\/\/doi.org\/10.1109\/TR.2022.3162346","journal-title":"In: IEEE Trans Reliab"},{"key":"16687_CR20","doi-asserted-by":"publisher","first-page":"697634","DOI":"10.3389\/fnbot.2021.697634","volume":"15","author":"D Liu","year":"2021","unstructured":"Liu D, Wang Z, Wang L, Chen L (2021) Multi-modal fusion emotion recognition method of speech expression based on deep learning. Front Neurorobot 15:697634","journal-title":"Front Neurorobot"},{"issue":"28","key":"16687_CR21","doi-asserted-by":"publisher","first-page":"322","DOI":"10.1016\/j.neucom.2019.06.085","volume":"364","author":"F Xiao","year":"2019","unstructured":"Xiao F, Gong X, Zhang Y, Shen Y, Gao X (2019) DAA: Dual LSTMs with adaptive attention for image captioning. Neurocomputing 364(28):322\u2013329","journal-title":"Neurocomputing"},{"key":"16687_CR22","doi-asserted-by":"crossref","unstructured":"Huang G (2018) \"Haifeng Hu\", c-RNN: A Fine-Grained Language Model for Image Captioning\", Neural Process Lett, 11","DOI":"10.1007\/s11063-018-9836-2"},{"key":"16687_CR23","doi-asserted-by":"publisher","first-page":"100","DOI":"10.1016\/j.image.2018.06.002","volume":"67","author":"W Chunlei","year":"2018","unstructured":"Chunlei W, Wei Y, Chu X, Fei S, Wang L (2018) Modeling visual and word-conditional semantic attention for image captioning. Signal Process Image Commun 67:100\u2013107","journal-title":"Signal Process Image Commun"},{"key":"16687_CR24","doi-asserted-by":"crossref","unstructured":"Yang J, Sun Y, Liang J, Ren B, Lai S-H (2018) Image captioning by incorporating affective concepts learned from both visual and textual components. Neurocomputing, 20","DOI":"10.1016\/j.neucom.2018.03.078"},{"key":"16687_CR25","doi-asserted-by":"crossref","unstructured":"Tan YH, Chan CS (2018) Phrase-based Image Caption Generator with Hierarchical LSTM Network. Neurocomputing, 28","DOI":"10.1016\/j.neucom.2018.12.026"},{"key":"16687_CR26","doi-asserted-by":"crossref","unstructured":"Yuan A, Li X, Xiaoqiang L (2018) 3G structure for image caption generation. Neurocomputing, 1","DOI":"10.1016\/j.neucom.2018.10.059"},{"key":"16687_CR27","unstructured":"Chen X, Zhang M, Zheng W, Lin Z, Yang Y (2018) Leveraging Unpaired Out-of-Domain Data for Image Captioning. Pattern Recognition Letters, In press, accepted manuscript, 30"},{"key":"16687_CR28","doi-asserted-by":"publisher","first-page":"26661","DOI":"10.1007\/s11042-020-09294-7","volume":"79","author":"X Shen","year":"2020","unstructured":"Shen X, Liu B, Zhou Y et al (2020) Remote sensing image caption generation via transformer and reinforcement learning. Multimed Tools Appl 79:26661\u201326682. https:\/\/doi.org\/10.1007\/s11042-020-09294-7","journal-title":"Multimed Tools Appl"},{"key":"16687_CR29","doi-asserted-by":"publisher","first-page":"24225","DOI":"10.1007\/s11042-020-09110-2","volume":"79","author":"P Xia","year":"2020","unstructured":"Xia P, He J, Yin J (2020) Boosting image caption generation with feature fusion module. Multimed Tools Appl 79:24225\u201324239. https:\/\/doi.org\/10.1007\/s11042-020-09110-2","journal-title":"Multimed Tools Appl"},{"key":"16687_CR30","doi-asserted-by":"publisher","first-page":"35721","DOI":"10.1007\/s11042-021-11106-5","volume":"80","author":"A Singh","year":"2021","unstructured":"Singh A, Singh TD, Bandyopadhyay S (2021) An encoder-decoder based framework for hindi image caption generation. Multimed Tools Appl 80:35721\u201335740. https:\/\/doi.org\/10.1007\/s11042-021-11106-5","journal-title":"Multimed Tools Appl"},{"key":"16687_CR31","doi-asserted-by":"publisher","first-page":"763","DOI":"10.1007\/s12559-018-9581-x","volume":"11","author":"G Ding","year":"2019","unstructured":"Ding G, Chen M, Zhao S et al (2019) Neural Image Caption Generation with Weighted Training and Reference. Cogn Comput 11:763\u2013777. https:\/\/doi.org\/10.1007\/s12559-018-9581-x","journal-title":"Cogn Comput"},{"key":"16687_CR32","doi-asserted-by":"publisher","first-page":"25557","DOI":"10.1007\/s11042-021-10632-6","volume":"80","author":"Z Ye","year":"2021","unstructured":"Ye Z, Khan R, Naqvi N et al (2021) A novel automatic image caption generation using bidirectional long-short term memory framework. Multimed Tools Appl 80:25557\u201325582. https:\/\/doi.org\/10.1007\/s11042-021-10632-6","journal-title":"Multimed Tools Appl"},{"key":"16687_CR33","doi-asserted-by":"publisher","first-page":"1377","DOI":"10.1007\/s00500-019-03973-w","volume":"24","author":"H Zhang","year":"2020","unstructured":"Zhang H, Qiu D, Wu R et al (2020) Novel model to integrate word embeddings and syntactic trees for automatic caption generation from images. Soft Comput 24:1377\u20131397. https:\/\/doi.org\/10.1007\/s00500-019-03973-w","journal-title":"Soft Comput"},{"key":"16687_CR34","doi-asserted-by":"publisher","unstructured":"Tiwary T, Mahapatra RP (2022) An accurate generation of image captions for blind people using extended convolutional atom neural network. Multimed Tools Appl. https:\/\/doi.org\/10.1007\/s11042-022-13443-5","DOI":"10.1007\/s11042-022-13443-5"},{"key":"16687_CR35","doi-asserted-by":"publisher","first-page":"17899","DOI":"10.1007\/s00521-019-04515-z","volume":"32","author":"N Gupta","year":"2020","unstructured":"Gupta N, Jalal AS (2020) Integration of textual cues for fine-grained image captioning using deep CNN and LSTM. Neural Comput & Applic 32:17899\u201317908. https:\/\/doi.org\/10.1007\/s00521-019-04515-z","journal-title":"Neural Comput & Applic"},{"key":"16687_CR36","doi-asserted-by":"publisher","first-page":"93","DOI":"10.1016\/j.ijar.2020.12.016","volume":"131","author":"C Chenga","year":"2021","unstructured":"Chenga C, Lia C, Hana Y, Zhub Y (2021) A semi-supervised deep learning image caption model based on Pseudo Label and N-gram. Int J Approx Reason 131:93\u2013107","journal-title":"Int J Approx Reason"},{"key":"16687_CR37","doi-asserted-by":"publisher","DOI":"10.1016\/j.compag.2023.107863","volume":"209","author":"S Wang","year":"2023","unstructured":"Wang S, Zeng Q, Ni W, Cheng C, Wang Y (2023) ODP-Transformer: Interpretation of pest classification results using image caption generation techniques. Comput Electron Agric 209:107863","journal-title":"Comput Electron Agric"},{"key":"16687_CR38","doi-asserted-by":"publisher","first-page":"354","DOI":"10.1016\/j.patcog.2017.10.013","volume":"77","author":"G Jiuxiang","year":"2018","unstructured":"Jiuxiang G, Wang Z, Kuen J, Ma L, Shahroudy A, Shuai B, Liu T, Wang X, Wang G, Cai J, Chen T (2018) Recent advances in convolutional neural networks. Pattern Recogn 77:354\u2013377","journal-title":"Pattern Recogn"},{"key":"16687_CR39","doi-asserted-by":"crossref","unstructured":"Zhou X, Lin J, Zhang Z, Shao Z, Liu H, \u201cImproved itracker combined with bidirectional long short-term memory for 3D gaze estimation using appearance cues\u201d, Neuro computing In press, corrected proof, Available online 20 2019.","DOI":"10.1016\/j.neucom.2019.04.099"},{"key":"16687_CR40","doi-asserted-by":"publisher","first-page":"849","DOI":"10.1016\/j.future.2019.02.028","volume":"97","author":"AA Heidari","year":"2019","unstructured":"Heidari AA, Mirjalili S, Faris H, Aljarah I, Mafarja M, Chen H (2019) Harris hawks optimization: Algorithm and applications. Futur Gener Comput Syst 97:849\u2013872","journal-title":"Futur Gener Comput Syst"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-16687-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-023-16687-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-16687-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,3,7]],"date-time":"2024-03-07T08:38:22Z","timestamp":1709800702000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-023-16687-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,9,14]]},"references-count":40,"journal-issue":{"issue":"10","published-online":{"date-parts":[[2024,3]]}},"alternative-id":["16687"],"URL":"https:\/\/doi.org\/10.1007\/s11042-023-16687-x","relation":{},"ISSN":["1573-7721"],"issn-type":[{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,9,14]]},"assertion":[{"value":"11 February 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 July 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 August 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 September 2023","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declaration"}},{"value":"The authors declare no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of Interest"}},{"value":"Not Applicable.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Informed consent"}},{"value":"Not Applicable.","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical approval"}}]}}