{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,2]],"date-time":"2026-04-02T12:12:53Z","timestamp":1775131973169,"version":"3.50.1"},"reference-count":72,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2026,2,3]],"date-time":"2026-02-03T00:00:00Z","timestamp":1770076800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,2,3]],"date-time":"2026-02-03T00:00:00Z","timestamp":1770076800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2026,4]]},"DOI":"10.1007\/s00530-025-02179-5","type":"journal-article","created":{"date-parts":[[2026,2,3]],"date-time":"2026-02-03T15:12:03Z","timestamp":1770131523000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Towards balancing the efficiency and effectiveness: a unified edit-based framework for automatic image captioning"],"prefix":"10.1007","volume":"32","author":[{"given":"Ruifan","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Siwei","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pengyue","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fangxiang","family":"Feng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhangyu","family":"Ma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,2,3]]},"reference":[{"key":"2179_CR1","doi-asserted-by":"publisher","first-page":"34219","DOI":"10.1007\/s11042-024-18307-8","volume":"83","author":"AS Al-Shamayleh","year":"2024","unstructured":"Al-Shamayleh, A.S., Adwan, O., Alsharaiah, M.A., Hussein, A.H., Kharma, Q.M., Eke, C.I.: A comprehensive literature review on image captioning methods and metrics based on deep learning technique. Multim. Tools Appl. 83, 34219\u201334268 (2024)","journal-title":"Multim. Tools Appl."},{"key":"2179_CR2","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109420","volume":"138","author":"Y Ma","year":"2023","unstructured":"Ma, Y., Ji, J., Sun, X., Zhou, Y., Ji, R.: Towards local visual modeling for image captioning. Pattern Recogn. 138, 109420 (2023)","journal-title":"Pattern Recogn."},{"key":"2179_CR3","doi-asserted-by":"crossref","unstructured":"Nguyen, V., Suganuma, M., Okatani, T.: GRIT: faster and better image captioning transformer using dual visual features. In: ECCV, vol. 13696, pp. 167\u2013184 (2022)","DOI":"10.1007\/978-3-031-20059-5_10"},{"key":"2179_CR4","doi-asserted-by":"crossref","unstructured":"Cornia, M., Stefanini, M., Baraldi, L., Cucchiara, R.: Meshed-memory transformer for image captioning. In: CVPR, pp. 10575\u201310584 (2020)","DOI":"10.1109\/CVPR42600.2020.01059"},{"key":"2179_CR5","doi-asserted-by":"crossref","unstructured":"Fei, Z., Fan, M., Zhu, L., Huang, J., Wei, X., Wei, X.: Uncertainty-aware image captioning. In: AAAI, pp. 614\u2013622 (2023)","DOI":"10.1609\/aaai.v37i1.25137"},{"key":"2179_CR6","doi-asserted-by":"crossref","unstructured":"Guo, L., Liu, J., Zhu, X., He, X., Jiang, J., Lu, H.: Non-autoregressive image captioning with counterfactuals-critical multi-agent learning. In: IJCAI, pp. 767\u2013773 (2020)","DOI":"10.24963\/ijcai.2020\/107"},{"key":"2179_CR7","doi-asserted-by":"crossref","unstructured":"Fei, Z.: Iterative back modification for faster image captioning. In: ACM MM, pp. 3182\u20133190 (2020)","DOI":"10.1145\/3394171.3413901"},{"key":"2179_CR8","doi-asserted-by":"crossref","unstructured":"Bouthors, M., Crego, J.M., Yvon, F.: Towards example-based NMT with multi-levenshtein transformers. In: Bouamor, H., Pino, J., Bali, K. (eds.) EMNLP, pp. 1830\u20131846 (2023)","DOI":"10.18653\/v1\/2023.emnlp-main.113"},{"key":"2179_CR9","first-page":"311","volume":"9","author":"W Xu","year":"2021","unstructured":"Xu, W., Carpuat, M.: EDITOR: an edit-based transformer with repositioning for neural machine translation with soft lexical constraints. T-ACL 9, 311\u2013328 (2021)","journal-title":"T-ACL"},{"key":"2179_CR10","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin transformer: hierarchical vision transformer using shifted windows. In: ICCV, pp. 9992\u201310002 (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"2179_CR11","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: ECCV, pp. 213\u2013229 (2020)","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"2179_CR12","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1023\/A:1022672621406","volume":"8","author":"RJ Williams","year":"1992","unstructured":"Williams, R.J.: Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach. Learn. 8, 229\u2013256 (1992)","journal-title":"Mach. Learn."},{"key":"2179_CR13","doi-asserted-by":"crossref","unstructured":"Rennie, S.J., Marcheret, E., Mroueh, Y., Ross, J., Goel, V.: Self-critical sequence training for image captioning. In: CVPR, pp. 1179\u20131195 (2017)","DOI":"10.1109\/CVPR.2017.131"},{"key":"2179_CR14","doi-asserted-by":"crossref","unstructured":"Vedantam, R., Zitnick, C.L., Parikh, D.: Cider: consensus-based image description evaluation. In: CVPR, pp. 4566\u20134575 (2015)","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"2179_CR15","first-page":"1999","volume-title":"ICML","author":"W Chung","year":"2021","unstructured":"Chung, W., Thomas, V., Machado, M.C., Roux, N.L.: Beyond variance reduction: understanding the true impact of baselines on policy optimization. In: Meila, M., Zhang, T. (eds.) ICML, vol. 139, pp. 1999\u20132009. PMLR, London (2021)"},{"key":"2179_CR16","doi-asserted-by":"crossref","unstructured":"Lin, T., Maire, M., Belongie, S.J., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., Zitnick, C.L.: Microsoft COCO: common objects in context. In: ECCV, vol. 8693, pp. 740\u2013755 (2014)","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"2179_CR17","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Fei-Fei, L.: Deep visual-semantic alignments for generating image descriptions. In: CVPR, pp. 3128\u20133137 (2015)","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"2179_CR18","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., Zhu, W.: Bleu: a method for automatic evaluation of machine translation. In: ACL, pp. 311\u2013318 (2002)","DOI":"10.3115\/1073083.1073135"},{"key":"2179_CR19","doi-asserted-by":"crossref","unstructured":"Lavie, A., Agarwal, A.: METEOR: an automatic metric for MT evaluation with high levels of correlation with human judgments. In: Workshop on Statistical Machine Translation, WMT@ACL, pp. 228\u2013231 (2007)","DOI":"10.3115\/1626355.1626389"},{"key":"2179_CR20","unstructured":"Lin, C.-Y.: ROUGE: A package for automatic evaluation of summaries. In: Text Summarization Branches Out, pp. 74\u201381 (2004)"},{"key":"2179_CR21","doi-asserted-by":"crossref","unstructured":"Anderson, P., Fernando, B., Johnson, M., Gould, S.: SPICE: semantic propositional image caption evaluation. In: ECCV, vol. 9909, pp. 382\u2013398 (2016)","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"2179_CR22","doi-asserted-by":"crossref","unstructured":"Fei, Z., Yan, X., Wang, S., Tian, Q.: DeeCap: dynamic early exiting for efficient image captioning. In: CVPR, pp. 12206\u201312216 (2022)","DOI":"10.1109\/CVPR52688.2022.01190"},{"key":"2179_CR23","doi-asserted-by":"crossref","unstructured":"Pan, Y., Yao, T., Li, Y., Mei, T.: X-linear attention networks for image captioning. In: CVPR, pp. 10968\u201310977 (2020)","DOI":"10.1109\/CVPR42600.2020.01098"},{"key":"2179_CR24","doi-asserted-by":"crossref","unstructured":"Luo, Y., Ji, J., Sun, X., Cao, L., Wu, Y., Huang, F., Lin, C., Ji, R.: Dual-level collaborative transformer for image captioning. In: AAAI, pp. 2286\u20132293 (2021)","DOI":"10.1609\/aaai.v35i3.16328"},{"key":"2179_CR25","doi-asserted-by":"crossref","unstructured":"Ji, J., Luo, Y., Sun, X., Chen, F., Luo, G., Wu, Y., Gao, Y., Ji, R.: Improving image captioning by leveraging intra- and inter-layer global representation in transformer network. In: AAAI, pp. 1655\u20131663 (2021)","DOI":"10.1609\/aaai.v35i2.16258"},{"key":"2179_CR26","doi-asserted-by":"crossref","unstructured":"Song, Z., Zhou, X., Dong, L., Tan, J., Guo, L.: Direction relation transformer for image captioning. In: ACM MM, pp. 5056\u20135064 (2021)","DOI":"10.1145\/3474085.3475607"},{"key":"2179_CR27","doi-asserted-by":"crossref","unstructured":"Wang, Y., Xu, J., Sun, Y.: End-to-end transformer based model for image captioning. In: AAAI, pp. 2585\u20132594 (2022)","DOI":"10.1609\/aaai.v36i3.20160"},{"key":"2179_CR28","doi-asserted-by":"crossref","unstructured":"Zeng, P., Zhu, J., Song, J., Gao, L.: Progressive tree-structured prototype network for end-to-end image captioning. In: ACM MM, pp. 5210\u20135218 (2022)","DOI":"10.1145\/3503161.3548024"},{"key":"2179_CR29","doi-asserted-by":"publisher","first-page":"6904","DOI":"10.1109\/TMM.2022.3215861","volume":"25","author":"N Hu","year":"2023","unstructured":"Hu, N., Ming, Y., Fan, C., Feng, F., Lyu, B.: TSFNet: triple-steam image captioning. IEEE Trans. Multim. 25, 6904\u20136916 (2023)","journal-title":"IEEE Trans. Multim."},{"key":"2179_CR30","doi-asserted-by":"crossref","unstructured":"Wang, T., Chen, W., Tian, Y., Song, Y., Mao, Z.: Improving image captioning via predicting structured concepts. In: EMNLP, pp. 360\u2013370 (2023)","DOI":"10.18653\/v1\/2023.emnlp-main.25"},{"key":"2179_CR31","doi-asserted-by":"publisher","first-page":"3962","DOI":"10.1109\/TMM.2022.3169061","volume":"25","author":"J Ji","year":"2023","unstructured":"Ji, J., Huang, X., Sun, X., Zhou, Y., Luo, G., Cao, L., Liu, J., Shao, L., Ji, R.: Multi-branch distance-sensitive self-attention network for image captioning. IEEE Trans. Multim. 25, 3962\u20133974 (2023)","journal-title":"IEEE Trans. Multim."},{"key":"2179_CR32","doi-asserted-by":"crossref","unstructured":"Zhang, P., Li, X., Hu, X., Yang, J., Zhang, L., Wang, L., Choi, Y., Gao, J.: VinVL: revisiting visual representations in vision-language models. In: CVPR, pp. 5579\u20135588 (2021)","DOI":"10.1109\/CVPR46437.2021.00553"},{"key":"2179_CR33","unstructured":"Wang, Z., Yu, J., Yu, A.W., Dai, Z., Tsvetkov, Y., Cao, Y.: SimVLM: simple visual language model pretraining with weak supervision. In: ICLR (2022)"},{"key":"2179_CR34","unstructured":"Wang, P., Yang, A., Men, R., Lin, J., Bai, S., Li, Z., Ma, J., Zhou, C., Zhou, J., Yang, H.: OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework. In: ICML, vol. 162, pp. 23318\u201323340 (2022)"},{"key":"2179_CR35","unstructured":"Wang, J., Yang, Z., Hu, X., Li, L., Lin, K., Gan, Z., Liu, Z., Liu, C., Wang, L.: GIT: a generative image-to-text transformer for vision and language. Trans. Mach. Learn. Res. (2022)"},{"key":"2179_CR36","unstructured":"Li, J., Li, D., Savarese, S., Hoi, S.C.H.: BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models. In: ICML, vol. 202, pp. 19730\u201319742 (2023)"},{"key":"2179_CR37","doi-asserted-by":"crossref","unstructured":"Lee, J., Mansimov, E., Cho, K.: Deterministic non-autoregressive neural sequence modeling by iterative refinement. In: EMNLP, pp. 1173\u20131182 (2018)","DOI":"10.18653\/v1\/D18-1149"},{"key":"2179_CR38","unstructured":"Gao, J., Meng, X., Wang, S., Li, X., Wang, S., Ma, S., Gao, W.: Masked non-autoregressive image captioning. CoRR (2019). arXiv:abs\/1906.00717"},{"key":"2179_CR39","unstructured":"Fei, Z.: Fast image caption generation with position alignment. CoRR (2019). arXiv:abs\/1912.06365"},{"key":"2179_CR40","doi-asserted-by":"crossref","unstructured":"Yan, X., Fei, Z., Li, Z., Wang, S., Huang, Q., Tian, Q.: Semi-autoregressive image captioning. In: ACM MM, pp. 2708\u20132716 (2021)","DOI":"10.1145\/3474085.3475179"},{"key":"2179_CR41","doi-asserted-by":"crossref","unstructured":"Ma, Z., Wang, C., Huang, B., Zhu, Z., Zhang, J.: Bounding and filling: a fast and flexible framework for image captioning. In: NLPCC, vol. 14302, pp. 469\u2013481. Springer, Hangzhou (2023)","DOI":"10.1007\/978-3-031-44693-1_37"},{"key":"2179_CR42","doi-asserted-by":"crossref","unstructured":"Luo, J., Li, Y., Pan, Y., Yao, T., Feng, J., Chao, H., Mei, T.: Semantic-conditional diffusion networks for image captioning. In: CVPR, pp. 23359\u201323368 (2023)","DOI":"10.1109\/CVPR52729.2023.02237"},{"key":"2179_CR43","unstructured":"Chen, T., Zhang, R., Hinton, G.E.: Analog bits: Generating discrete data using diffusion models with self-conditioning. In: ICLR (2023)"},{"key":"2179_CR44","doi-asserted-by":"crossref","unstructured":"Wang, Z., Jiang, X., Xiao, J., Chen, T., Chen, L.: DECap: towards generalized explicit caption editing via diffusion mechanism. In: European Conference on Computer Vision, pp. 365\u2013381 (2024)","DOI":"10.1007\/978-3-031-72775-7_21"},{"key":"2179_CR45","doi-asserted-by":"crossref","unstructured":"Wang, Y., Ren, S., Gao, R., Yao, L., Guo, Q., An, K., Bai, J., Sun, X.: LaDiC: are diffusion models really inferior to autoregressive counterparts for image-to-text generation? In: Duh, K., Gomez, H., Bethard, S. (eds.) Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers), pp. 6699\u20136715. Association for Computational Linguistics, Mexico City (2024)","DOI":"10.18653\/v1\/2024.naacl-long.373"},{"key":"2179_CR46","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, L., Polosukhin, I.: Attention is all you need. In: NeuIPS, pp. 5998\u20136008 (2017)"},{"key":"2179_CR47","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"2179_CR48","doi-asserted-by":"crossref","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., Zhang, L.: Bottom-up and top-down attention for image captioning and visual question answering. In: CVPR, pp. 6077\u20136086 (2018)","DOI":"10.1109\/CVPR.2018.00636"},{"key":"2179_CR49","doi-asserted-by":"crossref","unstructured":"Wu, M., Zhang, X., Sun, X., Zhou, Y., Chen, C., Gu, J., Sun, X., Ji, R.: DIFNet: boosting visual information flow for image captioning. In: CVPR, pp. 17999\u201318008. IEEE, New Orleans (2022)","DOI":"10.1109\/CVPR52688.2022.01749"},{"issue":"1","key":"2179_CR50","doi-asserted-by":"publisher","first-page":"539","DOI":"10.1109\/TPAMI.2022.3148210","volume":"45","author":"M Stefanini","year":"2023","unstructured":"Stefanini, M., Cornia, M., Baraldi, L., Cascianelli, S., Fiameni, G., Cucchiara, R.: From show to tell: a survey on deep learning-based image captioning. T-PAMI 45(1), 539\u2013559 (2023)","journal-title":"T-PAMI"},{"key":"2179_CR51","doi-asserted-by":"crossref","unstructured":"Li, Y., Pan, Y., Yao, T., Mei, T.: Comprehending and ordering semantics for image captioning. In: CVPR, pp. 17969\u201317978 (2022)","DOI":"10.1109\/CVPR52688.2022.01746"},{"key":"2179_CR52","series-title":"Proceedings of Machine Learning Research","first-page":"8748","volume-title":"ICML","author":"A Radford","year":"2021","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., Sutskever, I.: Learning transferable visual models from natural language supervision. In: Meila, M., Zhang, T. (eds.) ICML. Proceedings of Machine Learning Research, vol. 139, pp. 8748\u20138763. PMLR, London (2021)"},{"key":"2179_CR53","doi-asserted-by":"crossref","unstructured":"Gao, J., Wang, S., Wang, S., Ma, S., Gao, W.: Self-critical n-step training for image captioning. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00646"},{"key":"2179_CR54","doi-asserted-by":"crossref","unstructured":"Honda, U., Watanabe, T., Matsumoto, Y.: Switching to discriminative image captioning by relieving a bottleneck of reinforcement learning. In: CVPR, pp. 1124\u20131134 (2023)","DOI":"10.1109\/WACV56688.2023.00118"},{"key":"2179_CR55","doi-asserted-by":"crossref","unstructured":"Hirota, Y., Nakashima, Y., Garcia, N.: Model-agnostic gender debiased image captioning. In: CVPR, pp. 15191\u201315200 (2023)","DOI":"10.1109\/CVPR52729.2023.01458"},{"key":"2179_CR56","doi-asserted-by":"crossref","unstructured":"Qiu, H., Dou, Z.-Y., Wang, T., Celikyilmaz, A., Peng, N.: Gender biases in automatic evaluation metrics for image captioning. In: EMNLP (2023)","DOI":"10.18653\/v1\/2023.emnlp-main.520"},{"key":"2179_CR57","doi-asserted-by":"crossref","unstructured":"Zhao, D., Wang, A., Russakovsky, O.: Understanding and evaluating racial biases in image captioning. In: CVPR, pp. 14830\u201314840 (2021)","DOI":"10.1109\/ICCV48922.2021.01456"},{"key":"2179_CR58","doi-asserted-by":"crossref","unstructured":"Zhang, W., Shi, H., Guo, J., Zhang, S., Cai, Q., Li, J., Luo, S., Zhuang, Y.: Magic: multimodal relational graph adversarial inference for diverse and unpaired text-based image captioning. In: AAAI, vol. 36, pp. 3335\u20133343 (2022)","DOI":"10.1609\/aaai.v36i3.20243"},{"key":"2179_CR59","doi-asserted-by":"crossref","unstructured":"Xu, G., Niu, S., Tan, M., Luo, Y., Du, Q., Wu, Q.: Towards accurate text-based image captioning with content diversity exploration. In: CVPR, pp. 12637\u201312646 (2021)","DOI":"10.1109\/CVPR46437.2021.01245"},{"key":"2179_CR60","doi-asserted-by":"crossref","unstructured":"Tang, W., Hu, Z., Song, Z., Hong, R.: OCR-oriented master object for text image captioning. In: ICMR, pp. 39\u201343 (2022)","DOI":"10.1145\/3512527.3531431"},{"key":"2179_CR61","doi-asserted-by":"crossref","unstructured":"Wang, N., Xie, J., Wu, J., Jia, M., Li, L.: Controllable image captioning via prompting. In: Williams, B., Chen, Y., Neville, J. (eds.) Proceedings of the Thirty-Seventh AAAI Conference on Artificial Intelligence, pp. 2617\u20132625. AAAI Press, Washington, DC (2023)","DOI":"10.1609\/aaai.v37i2.25360"},{"key":"2179_CR62","doi-asserted-by":"crossref","unstructured":"Deng, C., Ding, N., Tan, M., Wu, Q.: Length-controllable image captioning. In: ECCV, vol. 12358, pp. 712\u2013729 (2020)","DOI":"10.1007\/978-3-030-58601-0_42"},{"key":"2179_CR63","doi-asserted-by":"crossref","unstructured":"Mathews, A., Xie, L., He, X.: SentiCap: generating image descriptions with sentiments. In: AAAI, p. 30 (2016)","DOI":"10.1609\/aaai.v30i1.10475"},{"key":"2179_CR64","doi-asserted-by":"crossref","unstructured":"Hirsch, E., Tal, A.: CLID: controlled-length image descriptions with limited data. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 5531\u20135541 (2024)","DOI":"10.1109\/WACV57701.2024.00544"},{"key":"2179_CR65","doi-asserted-by":"publisher","first-page":"379","DOI":"10.1109\/TMM.2023.3265842","volume":"26","author":"P Zhu","year":"2024","unstructured":"Zhu, P., Wang, X., Zhu, L., Sun, Z., Zheng, W., Wang, Y., Chen, C.: Prompt-based learning for unpaired image captioning. IEEE Trans. Multim. 26, 379\u2013393 (2024)","journal-title":"IEEE Trans. Multim."},{"key":"2179_CR66","doi-asserted-by":"publisher","first-page":"6702","DOI":"10.1109\/TMM.2022.3214090","volume":"25","author":"P Zhu","year":"2023","unstructured":"Zhu, P., Wang, X., Luo, Y., Sun, Z., Zheng, W., Wang, Y., Chen, C.: Unpaired image captioning by image-level weakly-supervised visual concept recognition. IEEE Trans. Multim. 25, 6702\u20136716 (2023)","journal-title":"IEEE Trans. Multim."},{"key":"2179_CR67","doi-asserted-by":"crossref","unstructured":"Wu, S., Fei, H., Ji, W., Chua, T.-S.: Cross2StrA: unpaired cross-lingual image captioning with cross-lingual cross-modal structure-pivoted alignment. In: ACL, pp. 2593\u20132608 (2023)","DOI":"10.18653\/v1\/2023.acl-long.146"},{"key":"2179_CR68","doi-asserted-by":"publisher","first-page":"904","DOI":"10.1109\/TMM.2021.3060948","volume":"24","author":"H Ben","year":"2022","unstructured":"Ben, H., Pan, Y., Li, Y., Yao, T., Hong, R., Wang, M., Mei, T.: Unpaired image captioning with semantic-constrained self-learning. IEEE Trans. Multim. 24, 904\u2013916 (2022)","journal-title":"IEEE Trans. Multim."},{"key":"2179_CR69","unstructured":"Gu, J., Bradbury, J., Xiong, C., Li, V.O.K., Socher, R.: Non-autoregressive neural machine translation. In: International Conference on Learning Representations (ICLR) (2018)"},{"key":"2179_CR70","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. Adv. Neural. Inf. Process. Syst. 33, 6840\u20136851 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2179_CR71","doi-asserted-by":"crossref","unstructured":"Li, Y., Zhou, K., Zhao, W.X., Wen, J.: Diffusion models for non-autoregressive text generation: a survey. In: IJCAI, pp. 6692\u20136701 (2023)","DOI":"10.24963\/ijcai.2023\/750"},{"key":"2179_CR72","doi-asserted-by":"crossref","unstructured":"Lee, J.R., Shin, Y., Son, G., Hwang, D.: Diffusion bridge: leveraging diffusion model to reduce the modality gap between text and vision for zero-shot image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4050\u20134059 (2025)","DOI":"10.1109\/CVPR52734.2025.00383"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-025-02179-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-025-02179-5","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-025-02179-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,2]],"date-time":"2026-04-02T11:35:28Z","timestamp":1775129728000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-025-02179-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,2,3]]},"references-count":72,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2026,4]]}},"alternative-id":["2179"],"URL":"https:\/\/doi.org\/10.1007\/s00530-025-02179-5","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,2,3]]},"assertion":[{"value":"8 August 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 December 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 February 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"145"}}