{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,9]],"date-time":"2026-05-09T17:20:01Z","timestamp":1778347201650,"version":"3.51.4"},"reference-count":58,"publisher":"Springer Science and Business Media LLC","issue":"34","license":[{"start":{"date-parts":[[2024,3,8]],"date-time":"2024-03-08T00:00:00Z","timestamp":1709856000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,3,8]],"date-time":"2024-03-08T00:00:00Z","timestamp":1709856000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Key Project of Hebei Provincial Department of Education","award":["ZD2020304"],"award-info":[{"award-number":["ZD2020304"]}]},{"name":"Special Fund of the National Natural Science Foundation of China","award":["62241103"],"award-info":[{"award-number":["62241103"]}]},{"name":"Hebei Province Fund Project for Overseas Researchers","award":["C20220316"],"award-info":[{"award-number":["C20220316"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-024-18680-4","type":"journal-article","created":{"date-parts":[[2024,3,8]],"date-time":"2024-03-08T07:01:27Z","timestamp":1709881287000},"page":"81857-81875","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Fine-grained image emotion captioning based on Generative Adversarial Networks"],"prefix":"10.1007","volume":"83","author":[{"given":"Chunmiao","family":"Yang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5451-8353","authenticated-orcid":false,"given":"Yang","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liying","family":"Han","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiran","family":"Jia","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hebin","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,3,8]]},"reference":[{"issue":"3","key":"18680_CR1","doi-asserted-by":"crossref","first-page":"2706","DOI":"10.1007\/s10489-022-03624-y","volume":"53","author":"J Wei","year":"2022","unstructured":"Wei J, Li Z, Zhu J et al (2022) Enhance understanding and reasoning ability for image captioning[J]. Appl Intell 53(3):2706\u20132722","journal-title":"Appl Intell"},{"issue":"C","key":"18680_CR2","doi-asserted-by":"crossref","first-page":"105920","DOI":"10.1016\/j.knosys.2020.105920","volume":"203","author":"X Shen","year":"2020","unstructured":"Shen X, Liu B, Zhou Y et al (2020) Remote sensing image captioning via variational autoencoder and reinforcement learning[J]. Knowl-Based Syst 203(C):105920\u2013105957","journal-title":"Knowl-Based Syst"},{"issue":"4","key":"18680_CR3","doi-asserted-by":"crossref","first-page":"642","DOI":"10.1007\/s11036-016-0805-6","volume":"22","author":"S Prasomphan","year":"2017","unstructured":"Prasomphan S, Jung EJ (2017) Mobile application for archaeological site image content retrieval and automated generating image descriptions with neural network[J]. Mob Netw Appl 22(4):642\u2013649","journal-title":"Mob Netw Appl"},{"issue":"5","key":"18680_CR4","doi-asserted-by":"crossref","first-page":"736","DOI":"10.1177\/0145482X221129619","volume":"116","author":"P Melanie","year":"2022","unstructured":"Melanie P, Katriana B, Lauren L et al (2022) Validation of image descriptions for the children\u2019s assessment of participation and enjoyment and preferences for activities of children: A delphi study[J]. J Vis Impair Blindness 116(5):736\u2013743","journal-title":"J Vis Impair Blindness"},{"key":"18680_CR5","doi-asserted-by":"crossref","first-page":"190","DOI":"10.1016\/j.isprsjprs.2022.02.001","volume":"186","author":"Y Qiaoqiao","year":"2022","unstructured":"Qiaoqiao Y, Zihao N, Peng R (2022) Meta captioning: A meta learning based remote sensing image captioning framework[J]. ISPRS J Photogramm Remote Sens 186:190\u2013200","journal-title":"ISPRS J Photogramm Remote Sens"},{"key":"18680_CR6","doi-asserted-by":"crossref","first-page":"150560","DOI":"10.1109\/ACCESS.2021.3124564","volume":"9","author":"P Hyeryun","year":"2021","unstructured":"Hyeryun P, Kyungmo K, Seongkeun P et al (2021) Medical image captioning model to convey more details: methodological comparison of feature difference generation[J]. IEEE Access 9:150560\u2013150568","journal-title":"IEEE Access"},{"issue":"1","key":"18680_CR7","doi-asserted-by":"crossref","first-page":"4171","DOI":"10.1038\/s41598-023-31223-5","volume":"13","author":"S Alexander","year":"2023","unstructured":"Alexander S, Rogov OY, Daniil C et al (2023) Medical image captioning via generative pretrained transformers [J]. Sci Rep 13(1):4171\u20134171","journal-title":"Sci Rep"},{"issue":"1","key":"18680_CR8","doi-asserted-by":"crossref","first-page":"209","DOI":"10.3390\/app12010209","volume":"12","author":"C YeongHwa","year":"2021","unstructured":"YeongHwa C, YenJen C, Ren Hung H et al (2021) Enhanced image captioning with color recognition using deep learning methods[J]. Appl Sci 12(1):209\u2013209","journal-title":"Appl Sci"},{"issue":"3","key":"18680_CR9","first-page":"1665","volume":"29","author":"NCD Tiago","year":"2022","unstructured":"Tiago NCD, Noronha DCV, G\u00e9lson JCD et al (2022) A reference-based model using deep learning for image captioning[J]. Multimedia Syst 29(3):1665\u20131681","journal-title":"Multimedia Syst"},{"issue":"12","key":"18680_CR10","doi-asserted-by":"crossref","first-page":"1417","DOI":"10.3390\/electronics8121417","volume":"8","author":"S He","year":"2019","unstructured":"He S, Lu Y (2019) A modularized architecture of multi-branch convolutional neural network for image captioning[J]. Electronics 8(12):1417\u20131432","journal-title":"Electronics"},{"key":"18680_CR11","doi-asserted-by":"crossref","first-page":"686","DOI":"10.1016\/j.procs.2023.01.049","volume":"218","author":"AP Kumar","year":"2023","unstructured":"Kumar AP, Rajneesh DR (2023) Hybrid architecture using CNN and LSTM for image captioning in Hindi language[J]. Procedia Comput Sci 218:686\u2013696","journal-title":"Procedia Comput Sci"},{"issue":"4","key":"18680_CR12","doi-asserted-by":"crossref","first-page":"5761","DOI":"10.3233\/JIFS-189415","volume":"40","author":"JA Alzubi","year":"2021","unstructured":"Alzubi JA, Rachna J, Preeti N et al (2021) Deep image captioning using an ensemble of CNN and LSTM based deep neural networks[J]. J Intell Fuzzy Syst 40(4):5761\u20135769","journal-title":"J Intell Fuzzy Syst"},{"key":"18680_CR13","doi-asserted-by":"crossref","first-page":"57943","DOI":"10.1109\/ACCESS.2020.2981513","volume":"8","author":"W Chunlei","year":"2020","unstructured":"Chunlei W, Shaozu Y, Haiwen C et al (2020) Hierarchical attention-based fusion for image caption with multi-grained rewards[J]. IEEE Access 8:57943\u201357951","journal-title":"IEEE Access"},{"key":"18680_CR14","doi-asserted-by":"crossref","first-page":"108545","DOI":"10.1016\/j.patcog.2022.108545","volume":"126","author":"Y Zuopeng","year":"2022","unstructured":"Zuopeng Y, Pengbo W, Tianshu C et al (2022) Human-centric image captioning[J]. Pattern Recogn 126:108545\u2013108056","journal-title":"Pattern Recogn"},{"key":"18680_CR15","doi-asserted-by":"crossref","first-page":"107114","DOI":"10.1016\/j.compeleceng.2021.107114","volume":"92","author":"SM Kumar","year":"2021","unstructured":"Kumar SM, Rijul D, Sriparna S et al (2021) Image captioning in Hindi language using transformer networks[J]. Comput Electr Eng 92:107114\u2013107126","journal-title":"Comput Electr Eng"},{"issue":"prepublish","key":"18680_CR16","doi-asserted-by":"crossref","first-page":"419","DOI":"10.1016\/j.neucom.2020.08.019","volume":"417","author":"S Cao","year":"2020","unstructured":"Cao S, An G, Zheng Z et al (2020) Interactions Guided Generative Adversarial Network for unsupervised image captioning[J]. Neurocomputing 417(prepublish):419\u2013431","journal-title":"Neurocomputing"},{"key":"18680_CR17","doi-asserted-by":"crossref","first-page":"64918","DOI":"10.1109\/ACCESS.2021.3075579","volume":"9","author":"MH Zakir","year":"2021","unstructured":"Zakir MH, Ferdous S, Fairuz MS et al (2021) Text to image synthesis for improved image captioning[J]. IEEE Access 9:64918\u201364928","journal-title":"IEEE Access"},{"key":"18680_CR18","doi-asserted-by":"crossref","first-page":"110482","DOI":"10.1016\/j.knosys.2023.110482","volume":"268","author":"W Xue","year":"2023","unstructured":"Xue W, Kun T, Pejun D et al (2023) A capsule-vectored neural network for hyperspectral image classification[J]. Knowl-Based Syst 268:110482\u2013110502","journal-title":"Knowl-Based Syst"},{"issue":"3","key":"18680_CR19","doi-asserted-by":"crossref","first-page":"183","DOI":"10.3390\/info14030183","volume":"14","author":"W Qifan","year":"2023","unstructured":"Qifan W, Aibin C, Yongfei X (2023) Liver CT image recognition method based on capsule network[J]. Information 14(3):183\u2013183","journal-title":"Information"},{"key":"18680_CR20","doi-asserted-by":"crossref","unstructured":"Sathiamoorthy S, Saravanan A, Ponnusamy R (2023) Mixture of histograms of autocorrelation based Chordiogram image descriptor for image retrieval[J]. Multimed Tools Appl 82(1):1313\u20131332","DOI":"10.1007\/s11042-022-13200-8"},{"issue":"1","key":"18680_CR21","first-page":"3574","volume":"30","author":"A Mathews","year":"2016","unstructured":"Mathews A, Xie L, He X (2016) Senticap: generating image descriptions with sentiments[J]. Proc AAAI Conf Artif Intell 30(1):3574\u20133580","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"18680_CR22","doi-asserted-by":"crossref","first-page":"24527","DOI":"10.1109\/ACCESS.2023.3255887","volume":"11","author":"S Ishikawa","year":"2023","unstructured":"Ishikawa S, Sugiura K (2023) Affective image captioning for visual artworks using emotion-based cross-attention mechanisms[J]. IEEE Access 11:24527\u201324534","journal-title":"IEEE Access"},{"issue":"3","key":"18680_CR23","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1109\/MIS.2023.3260992","volume":"38","author":"Y Lu","year":"2023","unstructured":"Lu Y, Guo C, Dai X et al (2023) Generating emotion descriptions for fine art paintings via multiple painting representations[J]. IEEE Intell Syst 38(3):31\u201340","journal-title":"IEEE Intell Syst"},{"key":"18680_CR24","doi-asserted-by":"crossref","unstructured":"Farhadi A, Hejrati M, Sadeghi M A, et al (2010) Every picture tells a story: generating sentences from images[A]. K. Daniilidis, P. Maragos, N. Paragios. Computer Vision \u2013 ECCV 2010[C]. Berlin, Heidelberg: Springer, 15\u201329","DOI":"10.1007\/978-3-642-15561-1_2"},{"key":"18680_CR25","first-page":"827","volume":"2019","author":"RC Luo","year":"2019","unstructured":"Luo RC, Hsu Y-T, Wen Y-C et al (2019) Visual image caption generation for service robotics and industrial applications[A]. 2019 IEEE Int Conf Ind Cyber Phys Syst (ICPS)[C] 2019:827\u2013832","journal-title":"2019 IEEE Int Conf Ind Cyber Phys Syst (ICPS)[C]"},{"issue":"8","key":"18680_CR26","doi-asserted-by":"crossref","first-page":"9731","DOI":"10.1007\/s10489-022-04010-4","volume":"53","author":"S Zhao","year":"2023","unstructured":"Zhao S, Li L, Peng H (2023) Incorporating retrieval-based method for feature enhanced image captioning[J]. Appl Intell 53(8):9731\u20139743","journal-title":"Appl Intell"},{"key":"18680_CR27","unstructured":"Karpathy A, Joulin A, Fei-Fei L (2014) Deep fragment embeddings for bidirectional image sentence mapping[J]. Advances in neural information processing systems 27:1\u20139"},{"key":"18680_CR28","doi-asserted-by":"crossref","first-page":"9627","DOI":"10.1109\/TIP.2020.3028651","volume":"29","author":"M Yang","year":"2020","unstructured":"Yang M, Liu J, Shen Y et al (2020) An ensemble of generation- and retrieval-based image captioning with dual generator generative adversarial network[J]. IEEE Trans Image Process 29:9627\u20139640","journal-title":"IEEE Trans Image Process"},{"key":"18680_CR29","unstructured":"Kiros R, Salakhutdinov R, Zemel R S (2014) Unifying visual-semantic embeddings with multimodal neural language models[J]. arXiv preprint arXiv:1411.2539\u00a0"},{"issue":"10","key":"18680_CR30","doi-asserted-by":"crossref","first-page":"11382","DOI":"10.1007\/s10489-021-02988-x","volume":"52","author":"J Shao","year":"2022","unstructured":"Shao J, Yang R (2022) Controllable image caption with an encoder-decoder optimization structure[J]. Appl Intell 52(10):11382\u201311393","journal-title":"Appl Intell"},{"issue":"28\u201329","key":"18680_CR31","doi-asserted-by":"crossref","first-page":"35721","DOI":"10.1007\/s11042-021-11106-5","volume":"80","author":"A Singh","year":"2021","unstructured":"Singh A, Singh TD, Bandyopadhyay S (2021) An encoder-decoder based framework for Hindi image caption generation[J]. Multimed Tools Appl 80(28\u201329):35721\u201335740","journal-title":"Multimed Tools Appl"},{"issue":"17","key":"18680_CR32","doi-asserted-by":"crossref","first-page":"25557","DOI":"10.1007\/s11042-021-10632-6","volume":"80","author":"Z Ye","year":"2021","unstructured":"Ye Z, Khan R, Naqvi N et al (2021) A novel automatic image caption generation using bidirectional long-short term memory framework[J]. Multimed Tools Appl 80(17):25557\u201325582","journal-title":"Multimed Tools Appl"},{"issue":"1","key":"18680_CR33","doi-asserted-by":"crossref","first-page":"18","DOI":"10.1186\/s40537-023-00693-9","volume":"10","author":"R Sasibhooshan","year":"2023","unstructured":"Sasibhooshan R, Kumaraswamy S, Sasidharan S (2023) Image caption generation using visual attention prediction and contextual spatial relation extraction[J]. J Big Data 10(1):18\u201336","journal-title":"J Big Data"},{"key":"18680_CR34","doi-asserted-by":"crossref","first-page":"106112","DOI":"10.1016\/j.engappai.2023.106112","volume":"123","author":"R Padate","year":"2023","unstructured":"Padate R, Jain A, Kalla M et al (2023) Image caption generation using a dual attention mechanism[J]. Eng Appl Artif Intell 123:106112\u2013106125","journal-title":"Eng Appl Artif Intell"},{"key":"18680_CR35","doi-asserted-by":"crossref","first-page":"107928","DOI":"10.1016\/j.patcog.2021.107928","volume":"115","author":"J Ji","year":"2021","unstructured":"Ji J, Du Z, Zhang X (2021) Divergent-convergent attention for image captioning[J]. Pattern Recogn 115:107928\u2013107940","journal-title":"Pattern Recogn"},{"issue":"1","key":"18680_CR36","doi-asserted-by":"crossref","first-page":"1223","DOI":"10.1007\/s11042-022-13279-z","volume":"82","author":"D Zhao","year":"2023","unstructured":"Zhao D, Yang R, Wang Z et al (2023) A cooperative approach based on self-attention with interactive attribute for image caption[J]. Multimed Tools Appl 82(1):1223\u20131236","journal-title":"Multimed Tools Appl"},{"key":"18680_CR37","doi-asserted-by":"crossref","first-page":"1250","DOI":"10.1109\/ACCESS.2020.3015656","volume":"9","author":"MZ Khan","year":"2021","unstructured":"Khan MZ, Jabeen S, Khan MUG et al (2021) A realistic image generation of face from text description using the fully trained Generative Adversarial Networks[J]. IEEE Access 9:1250\u20131260","journal-title":"IEEE Access"},{"key":"18680_CR38","doi-asserted-by":"crossref","unstructured":"Zhao W, Wu X, Zhang X (2020) MemCap: memorizing style knowledge for image captioning[C]. Proceedings of the AAAI Conference on Artificial Intelligence 34(7):12984\u201312992","DOI":"10.1609\/aaai.v34i07.6998"},{"issue":"8","key":"18680_CR39","doi-asserted-by":"crossref","first-page":"5098","DOI":"10.3390\/app13085098","volume":"13","author":"H Ku","year":"2023","unstructured":"Ku H, Lee M (2023) TextControlGAN: text-to-image synthesis with controllable Generative Adversarial Networks[J]. Appl Sci 13(8):5098\u20135110","journal-title":"Appl Sci"},{"issue":"9","key":"18680_CR40","doi-asserted-by":"crossref","first-page":"5239","DOI":"10.3390\/app13095239","volume":"13","author":"N Yolwas","year":"2023","unstructured":"Yolwas N, Meng W (2023) JSUM: A multitask learning speech recognition model for jointly supervised and unsupervised learning. Appl Sci 13(9):5239\u20135252","journal-title":"Appl Sci"},{"key":"18680_CR41","doi-asserted-by":"crossref","first-page":"170556","DOI":"10.1016\/j.jmmm.2023.170556","volume":"571","author":"S Pollok","year":"2023","unstructured":"Pollok S, Olden-J\u00f8rgensen N, J\u00f8rgensen PS et al (2023) Magnetic field prediction using generative adversarial networks[J]. J Magn Magn Mater 571:170556\u2013170566","journal-title":"J Magn Magn Mater"},{"issue":"5","key":"18680_CR42","doi-asserted-by":"crossref","first-page":"661","DOI":"10.1007\/s10548-023-00986-5","volume":"36","author":"P Mahey","year":"2023","unstructured":"Mahey P, Toussi N, Purnomu G et al (2023) Generative Adversarial Network (GAN) for simulating electroencephalography[J]. Brain Topogr 36(5):661\u2013670","journal-title":"Brain Topogr"},{"key":"18680_CR43","unstructured":"Sabour S, Frosst N, Hinton GE (2017) Dynamic routing between capsules[J]. Advances in neural information processing systems 30:1\u201311"},{"key":"18680_CR44","unstructured":"Bibi A, Abidi H, Dhaouadi O (2020) SeqCapsGAN: generating stylized image captions using capsule generative adversarial network[Online]"},{"key":"18680_CR45","first-page":"2970","volume":"2017","author":"B Dai","year":"2017","unstructured":"Dai B, Fidler S, Urtasun R et al (2017) Towards diverse and natural image descriptions via aconditional GAN[C]. IEEE Int Conf Comput Vision (ICCV) 2017:2970\u20132979","journal-title":"IEEE Int Conf Comput Vision (ICCV)"},{"key":"18680_CR46","doi-asserted-by":"crossref","first-page":"24527","DOI":"10.1109\/ACCESS.2023.3255887","volume":"11","author":"S Ishikawa","year":"2023","unstructured":"Ishikawa S, Sugiura et al (2023) Affective image captioning for visual artworks using emotion-based cross-attention mechanisms[J]. IEEE Access 11:24527\u201324534","journal-title":"IEEE Access"},{"key":"18680_CR47","doi-asserted-by":"crossref","unstructured":"Han C, Wang Q, Cui Y et al (2023) E2VPT: An effective and efficient approach for visual prompt tuning[J]. arXiv preprint arXiv:2307.13770","DOI":"10.1109\/ICCV51070.2023.01604"},{"key":"18680_CR48","doi-asserted-by":"crossref","unstructured":"Liu D, Chen Y, Cui Y et al (2021) SG-Net: Spatial Granularity Network for one-stage video instance segmentation[C]. Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 9816\u20139825","DOI":"10.1109\/CVPR46437.2021.00969"},{"key":"18680_CR49","doi-asserted-by":"crossref","first-page":"2678","DOI":"10.1109\/TIP.2023.3272826","volume":"32","author":"D Liu","year":"2023","unstructured":"Liu D, Liang J, Geng T et al (2023) Tripartite feature enhanced pyramid network for dense prediction[J]. IEEE Trans Image Process 32:2678\u20132692","journal-title":"IEEE Trans Image Process"},{"issue":"10","key":"18680_CR50","doi-asserted-by":"crossref","first-page":"6642","DOI":"10.1109\/TCSVT.2022.3177320","volume":"32","author":"L Yan","year":"2022","unstructured":"Yan L, Ma S, Wang Q et al (2022) Video captioning using global-local representation[J]. IEEE Trans Circ Syst Video Technol 32(10):6642\u20136656","journal-title":"IEEE Trans Circ Syst Video Technol"},{"key":"18680_CR51","doi-asserted-by":"crossref","first-page":"6543","DOI":"10.1109\/TIP.2023.3328485","volume":"32","author":"Z Qin","year":"2023","unstructured":"Qin Z, Xiankai Lu, Liu D et al (2023) Reformulating graph kernels for self-supervised space-time correspondence learning[J]. IEEE Trans Image Process 32:6543\u20136557","journal-title":"IEEE Trans Image Process"},{"key":"18680_CR52","first-page":"1622","volume":"2023","author":"L Yan","year":"2023","unstructured":"Yan L, Han C, Zenglin X et al (2023) Prompt learns prompt: exploring knowledge-aware generative prompt collaboration for video captioning[J]. Int Joint Conf Artif Intell Organ 2023:1622\u20131630","journal-title":"Int Joint Conf Artif Intell Organ"},{"key":"18680_CR53","unstructured":"Wang W, Liang J, Liu D (2022) Learning equivariant segmentation with instance-unique querying[J].  Advances in Neural Information Processing Systems 35:12826\u201312840"},{"issue":"6","key":"18680_CR54","doi-asserted-by":"crossref","first-page":"1083","DOI":"10.1109\/JAS.2022.105632","volume":"9","author":"J Liang","year":"2022","unstructured":"Liang J, Wang Y, Chen Y, Liu D et al (2022) A triangulation-based visual localization for field robots[J]. IEEE\/CAA J Automatica Sinica 9(6):1083\u20131086","journal-title":"IEEE\/CAA J Automatica Sinica"},{"key":"18680_CR55","doi-asserted-by":"crossref","first-page":"110047","DOI":"10.1016\/j.patcog.2023.110047","volume":"147","author":"J Wang","year":"2024","unstructured":"Wang J, Pang Y, Cao J et al (2024) Deep intra-image contrastive learning for weakly supervised one-step person search[J]. Pattern Recogn 147:110047","journal-title":"Pattern Recogn"},{"key":"18680_CR56","doi-asserted-by":"crossref","first-page":"3891","DOI":"10.1007\/s00530-023-01166-y","volume":"29","author":"J Chang","year":"2023","unstructured":"Chang J, Zhang L, Shao Z et al (2023) View-target relation-guided unsupervised 2D image-based 3D model retrieval via transformer[J]. Multimedia Syst 29:3891\u20133901","journal-title":"Multimedia Syst"},{"key":"18680_CR57","first-page":"1","volume":"2022","author":"Z Shao","year":"2024","unstructured":"Shao Z, Han J, Marnerides D et al (2024) Region-object relation-aware dense captioning via transformer[J]. IEEE Trans Neural Networks Learn Syst 2022:1\u201312","journal-title":"IEEE Trans Neural Networks Learn Syst"},{"key":"18680_CR58","doi-asserted-by":"crossref","first-page":"8753","DOI":"10.1109\/TMM.2023.3241517","volume":"25","author":"Z Shao","year":"2023","unstructured":"Shao Z, Han J, Debattista K et al (2023) Textual context-aware dense captioning with diverse words[J]. IEEE Trans Multimedia 25:8753\u20138766","journal-title":"IEEE Trans Multimedia"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-024-18680-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-024-18680-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-024-18680-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,9]],"date-time":"2024-10-09T12:12:50Z","timestamp":1728475970000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-024-18680-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,3,8]]},"references-count":58,"journal-issue":{"issue":"34","published-online":{"date-parts":[[2024,10]]}},"alternative-id":["18680"],"URL":"https:\/\/doi.org\/10.1007\/s11042-024-18680-4","relation":{},"ISSN":["1573-7721"],"issn-type":[{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,3,8]]},"assertion":[{"value":"24 October 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 January 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 February 2024","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 March 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflicts of interests"}}]}}