{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T16:58:56Z","timestamp":1780937936233,"version":"3.54.1"},"reference-count":52,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100006606","name":"Natural Science Foundation of Tianjin Municipality","doi-asserted-by":"publisher","award":["25JCQNJC01770"],"award-info":[{"award-number":["25JCQNJC01770"]}],"id":[{"id":"10.13039\/501100006606","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004945","name":"Nankai University","doi-asserted-by":"publisher","award":["NKYKK202512"],"award-info":[{"award-number":["NKYKK202512"]}],"id":[{"id":"10.13039\/501100004945","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004945","name":"Nankai University","doi-asserted-by":"publisher","award":["NKSGY202507"],"award-info":[{"award-number":["NKSGY202507"]}],"id":[{"id":"10.13039\/501100004945","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62402334"],"award-info":[{"award-number":["62402334"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62472303"],"award-info":[{"award-number":["62472303"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2024"],"award-info":[{"award-number":["U21B2024"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Expert Systems with Applications"],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1016\/j.eswa.2026.132014","type":"journal-article","created":{"date-parts":[[2026,3,21]],"date-time":"2026-03-21T15:56:01Z","timestamp":1774108561000},"page":"132014","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Towards social-aware image captioning via chain-of-thought prompting"],"prefix":"10.1016","volume":"321","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8613-7651","authenticated-orcid":false,"given":"Shenyuan","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7526-4356","authenticated-orcid":false,"given":"Ning","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-9417-8999","authenticated-orcid":false,"given":"Quanhan","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-3339-5485","authenticated-orcid":false,"given":"Chen","family":"Sun","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3047-6520","authenticated-orcid":false,"given":"Jinlin","family":"Guo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7635-0961","authenticated-orcid":false,"given":"Hongshuo","family":"Tian","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5755-9145","authenticated-orcid":false,"given":"An-An","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.eswa.2026.132014_bib0001","series-title":"CVPR","first-page":"6077","article-title":"Bottom-up and top-down attention for image captioning and visual question answering","author":"Anderson","year":"2018"},{"key":"10.1016\/j.eswa.2026.132014_bib0002","unstructured":"Bai, J. et al. (2023). Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond. arXiv: 2308.12966."},{"key":"10.1016\/j.eswa.2026.132014_bib0003","series-title":"ICCV","first-page":"3021","article-title":"With a little help from your own past: Prototypical memory networks for image captioning","author":"Barraco","year":"2023"},{"key":"10.1016\/j.eswa.2026.132014_bib0004","series-title":"NIPS","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020"},{"key":"10.1016\/j.eswa.2026.132014_bib0005","unstructured":"Chiang, W.-L., Li, Z., Lin, Z., Sheng, Y., Wu, Z., Zhang, H., Zheng, L., Zhuang, S., Zhuang, Y., Gonzalez, J. E. et al. (2023). Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. See https:\/\/vicuna. lmsys. org (accessed 14 April 2023), 2(3), 6."},{"key":"10.1016\/j.eswa.2026.132014_bib0006","series-title":"CVPR","first-page":"8307","article-title":"Show, control and tell: A framework for generating controllable and grounded captions","author":"Cornia","year":"2019"},{"key":"10.1016\/j.eswa.2026.132014_bib0007","first-page":"4171","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","volume":"1","author":"Devlin","year":"2019","journal-title":"NAACL-HLT"},{"key":"10.1016\/j.eswa.2026.132014_bib0008","series-title":"AAAI","first-page":"607","article-title":"Attention-aligned transformer for image captioning","volume":"vol. 36","author":"Fei","year":"2022"},{"key":"10.1016\/j.eswa.2026.132014_bib0009","article-title":"Multi-graph fusion for dynamic graph convolutional network","author":"Gan","year":"2022","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"10.1016\/j.eswa.2026.132014_bib0010","unstructured":"Gao, T., Fisch, A., & Chen, D. (2020). Making pre-trained language models better few-shot learners. arXiv: 2012.15723."},{"key":"10.1016\/j.eswa.2026.132014_bib0011","unstructured":"Huang, X., Zhang, Y., Ma, J., Tian, W., Feng, R., Zhang, Y., Li, Y., Guo, Y., & Zhang, L. (2023). Tag2text: Guiding vision-language model via image tagging. arXiv: 2303.05657."},{"key":"10.1016\/j.eswa.2026.132014_bib0012","series-title":"CVPR","first-page":"11039","article-title":"HAAV: Hierarchical aggregation of augmented views for image captioning","author":"Kuo","year":"2023"},{"issue":"11","key":"10.1016\/j.eswa.2026.132014_bib0013","doi-asserted-by":"crossref","first-page":"2278","DOI":"10.1109\/5.726791","article-title":"Gradient-based learning applied to document recognition","volume":"86","author":"LeCun","year":"1998","journal-title":"Proceedings of the IEEE"},{"key":"10.1016\/j.eswa.2026.132014_bib0014","series-title":"ICML","first-page":"19730","article-title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"issue":"7","key":"10.1016\/j.eswa.2026.132014_bib0015","doi-asserted-by":"crossref","first-page":"5266","DOI":"10.1109\/TCSVT.2023.3343520","article-title":"Cascade semantic prompt alignment network for image captioning","volume":"34","author":"Li","year":"2023","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132014_bib0016","series-title":"CVPR","first-page":"17990","article-title":"Comprehending and ordering semantics for image captioning","author":"Li","year":"2022"},{"key":"10.1016\/j.eswa.2026.132014_bib0017","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y., Maire, M., Belongie, S., Bourdev, L., Girshick, R., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C. L. (2014). Microsoft COCO: Common objects in context. In Computer Vision \u2013 ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part V, Lecture Notes in Computer Science, 8693, pp. 740\u2013755. Springer, Cham.","DOI":"10.1007\/978-3-319-10602-1_48"},{"issue":"9","key":"10.1016\/j.eswa.2026.132014_bib0018","first-page":"1","article-title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing","volume":"55","author":"Liu","year":"2023","journal-title":"ACM Computing Surveys"},{"key":"10.1016\/j.eswa.2026.132014_bib0019","series-title":"CVPR","first-page":"23359","article-title":"Semantic-conditional diffusion networks for image captioning","author":"Luo","year":"2023"},{"key":"10.1016\/j.eswa.2026.132014_bib0020","doi-asserted-by":"crossref","DOI":"10.1109\/TKDE.2023.3268069","article-title":"Multiplex graph representation learning via dual correlation reduction","author":"Mo","year":"2023","journal-title":"IEEE Transactions on Knowledge and Data Engineering"},{"key":"10.1016\/j.eswa.2026.132014_bib0021","doi-asserted-by":"crossref","DOI":"10.1109\/TGRS.2026.3650788","article-title":"A size-aware graph embedding approach to remote sensing image captioning with object relative size information","author":"Ni","year":"2026","journal-title":"IEEE Transactions on Geoscience and Remote Sensing"},{"key":"10.1016\/j.eswa.2026.132014_bib0022","unstructured":"OpenAI (2024). GPT-4o: Multimodal foundation models for real-time interaction. https:\/\/openai.com\/index\/gpt-4o\/. OpenAI Technical Report."},{"key":"10.1016\/j.eswa.2026.132014_bib0023","series-title":"NIPS","first-page":"27730","article-title":"Training language models to follow instructions with human feedback","volume":"vol. 35","author":"Ouyang","year":"2022"},{"key":"10.1016\/j.eswa.2026.132014_bib0024","series-title":"CVPR","first-page":"10971","article-title":"X-linear attention networks for image captioning","author":"Pan","year":"2020"},{"key":"10.1016\/j.eswa.2026.132014_bib0025","article-title":"GRLC: Graph representation learning with constraints","author":"Peng","year":"2022","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"10.1016\/j.eswa.2026.132014_bib0026","series-title":"ICML","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.eswa.2026.132014_bib0027","series-title":"CVPR","first-page":"2840","article-title":"SmallCap: lightweight image captioning prompted with retrieval augmentation","author":"Ramos","year":"2023"},{"issue":"1","key":"10.1016\/j.eswa.2026.132014_bib0028","doi-asserted-by":"crossref","first-page":"4171","DOI":"10.1038\/s41598-023-31223-5","article-title":"Medical image captioning via generative pretrained transformers","volume":"13","author":"Selivanov","year":"2023","journal-title":"Scientific Reports"},{"key":"10.1016\/j.eswa.2026.132014_bib0029","series-title":"Proceedings of the IEEE Delhi section conference (DELCON)","first-page":"1","article-title":"Automated image caption generation framework using adaptive attention and bi-LSTM","author":"Sharma","year":"2022"},{"key":"10.1016\/j.eswa.2026.132014_bib0030","series-title":"Proceedings of the 4th international conference on artificial intelligence and speech technology (AIST)","first-page":"1","article-title":"A review of stylized image captioning techniques, evaluation parameters, and datasets","author":"Sharma","year":"2022"},{"key":"10.1016\/j.eswa.2026.132014_bib0031","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.119773","article-title":"Evolution of visual data captioning methods, datasets, and evaluation metrics: A comprehensive survey","volume":"221","author":"Sharma","year":"2023","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.eswa.2026.132014_bib0032","doi-asserted-by":"crossref","DOI":"10.1109\/TCDS.2024.3405573","article-title":"Control with style: Style embedding-based variational autoencoder for controlled stylized caption generation framework","author":"Sharma","year":"2024","journal-title":"IEEE Transactions on Cognitive and Developmental Systems"},{"key":"10.1016\/j.eswa.2026.132014_bib0033","article-title":"Unma-Capsumt: Unified and multi-head attention driven caption summarization transformer","volume":"96","author":"Sharma","year":"2025","journal-title":"Journal of Visual Communication and Image Representation"},{"key":"10.1016\/j.eswa.2026.132014_bib0034","series-title":"Proceedings of the 16th international conference on signal-image technology & internet-based systems (SITIS)","first-page":"434","article-title":"Lightweight transformer with GRU integrated decoder for image captioning","author":"Sharma","year":"2022"},{"key":"10.1016\/j.eswa.2026.132014_bib0035","series-title":"ACL","first-page":"2556","article-title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","author":"Sharma","year":"2018"},{"key":"10.1016\/j.eswa.2026.132014_bib0036","series-title":"AAAI","first-page":"2584","article-title":"Image captioning with context-aware auxiliary guidance","volume":"vol. 35","author":"Song","year":"2021"},{"key":"10.1016\/j.eswa.2026.132014_bib0037","unstructured":"G. Team (2024). Gemini: A family of highly capable multimodal models. https:\/\/arxiv.org\/abs\/2312.11805Google DeepMind Technical Report."},{"key":"10.1016\/j.eswa.2026.132014_bib0038","unstructured":"Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T., Rozi\u00e8re, B., Goyal, N., Hambro, E., Azhar, F. et al. (2023). Llama: Open and efficient foundation language models. arXiv: 2302.13971."},{"key":"10.1016\/j.eswa.2026.132014_bib0039","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"13035","article-title":"Transform and tell: Entity-aware news image captioning","author":"Tran","year":"2020"},{"key":"10.1016\/j.eswa.2026.132014_bib0040","series-title":"NIPS","article-title":"Attention is all you need","volume":"vol. 30","author":"Vaswani","year":"2017"},{"key":"10.1016\/j.eswa.2026.132014_bib0041","doi-asserted-by":"crossref","unstructured":"Wang, B., Deng, X., & Sun, H. (2022). Iteratively prompt pre-trained language models for chain of thought. arXiv: 2203.08383.","DOI":"10.18653\/v1\/2022.emnlp-main.174"},{"issue":"5","key":"10.1016\/j.eswa.2026.132014_bib0042","doi-asserted-by":"crossref","first-page":"3563","DOI":"10.1109\/TCSVT.2023.3315133","article-title":"TridentCap: Image-fact-style trident semantic framework for stylized image captioning","volume":"34","author":"Wang","year":"2023","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132014_bib0043","series-title":"AAAI","first-page":"2617","article-title":"Controllable image captioning via prompting","volume":"vol. 37","author":"Wang","year":"2023"},{"key":"10.1016\/j.eswa.2026.132014_bib0044","first-page":"24824","article-title":"Chain-of-thought prompting elicits reasoning in large language models","volume":"35","author":"Wei","year":"2022","journal-title":"NeurIPS"},{"issue":"1","key":"10.1016\/j.eswa.2026.132014_bib0045","doi-asserted-by":"crossref","first-page":"43","DOI":"10.1109\/TCSVT.2021.3067449","article-title":"Task-adaptive attention for image captioning","volume":"32","author":"Yan","year":"2021","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132014_bib0046","series-title":"ECCV","first-page":"684","article-title":"Exploring visual relationship for image captioning","author":"Yao","year":"2018"},{"key":"10.1016\/j.eswa.2026.132014_bib0047","series-title":"ICCV","first-page":"4894","article-title":"Boosting image captioning with attributes","author":"Yao","year":"2017"},{"key":"10.1016\/j.eswa.2026.132014_bib0048","unstructured":"Zaremba, W., Sutskever, I., & Vinyals, O. (2014). Recurrent neural network regularization. arXiv preprint arXiv: 1409.2329."},{"issue":"6","key":"10.1016\/j.eswa.2026.132014_bib0049","doi-asserted-by":"crossref","first-page":"4829","DOI":"10.1109\/TCSVT.2023.3336371","article-title":"SPT: Spatial pyramid transformer for image captioning","volume":"34","author":"Zhang","year":"2023","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132014_bib0050","series-title":"CVPR","first-page":"16793","article-title":"RegionClip: Region-based language-image pretraining","author":"Zhong","year":"2022"},{"key":"10.1016\/j.eswa.2026.132014_bib0051","article-title":"Prompt-based learning for unpaired image captioning","author":"Zhu","year":"2023","journal-title":"IEEE Transactions on Multimedia"},{"key":"10.1016\/j.eswa.2026.132014_bib0052","doi-asserted-by":"crossref","first-page":"53","DOI":"10.1016\/j.inffus.2021.07.013","article-title":"Interpretable learning based dynamic graph convolutional networks for alzheimer\u2019s disease analysis","volume":"77","author":"Zhu","year":"2022","journal-title":"Information Fusion"}],"container-title":["Expert Systems with Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426009279?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426009279?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T16:09:10Z","timestamp":1780934950000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0957417426009279"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":52,"alternative-id":["S0957417426009279"],"URL":"https:\/\/doi.org\/10.1016\/j.eswa.2026.132014","relation":{},"ISSN":["0957-4174"],"issn-type":[{"value":"0957-4174","type":"print"}],"subject":[],"published":{"date-parts":[[2026,7]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Towards social-aware image captioning via chain-of-thought prompting","name":"articletitle","label":"Article Title"},{"value":"Expert Systems with Applications","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.eswa.2026.132014","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"132014"}}