{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,3]],"date-time":"2026-06-03T14:12:12Z","timestamp":1780495932983,"version":"3.54.1"},"reference-count":52,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100017592","name":"Key Science and Technology Program of Shaanxi Province","doi-asserted-by":"publisher","award":["2025JC-YBQN-801"],"award-info":[{"award-number":["2025JC-YBQN-801"]}],"id":[{"id":"10.13039\/501100017592","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62125207"],"award-info":[{"award-number":["62125207"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62472411"],"award-info":[{"award-number":["62472411"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012165","name":"Key Technologies Research and Development Program","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100012165","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004826","name":"Beijing Natural Science Foundation","doi-asserted-by":"publisher","award":["JQ24021"],"award-info":[{"award-number":["JQ24021"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011710","name":"Shaanxi Provincial Science and Technology Department","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100011710","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2024YFF0907605"],"award-info":[{"award-number":["2024YFF0907605"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113610","type":"journal-article","created":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T17:57:40Z","timestamp":1774461460000},"page":"113610","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PA","title":["Structured-condensed prompt tuning in vision-language models for fine-grained image recognition"],"prefix":"10.1016","volume":"179","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1981-7243","authenticated-orcid":false,"given":"Xinda","family":"Liu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-7565-2045","authenticated-orcid":false,"given":"Qinyu","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6668-9208","authenticated-orcid":false,"given":"Weiqing","family":"Min","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-8886-0332","authenticated-orcid":false,"given":"Guohua","family":"Geng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1596-4326","authenticated-orcid":false,"given":"Shuqiang","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113610_bib0001","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110452","article-title":"Zero-shot sketch-based image retrieval via adaptive relation-aware metric learning","volume":"152","author":"Liu","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113610_bib0002","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111806","article-title":"Complementary two-branch transformer for multi-label image retrieval","volume":"168","author":"Li","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113610_bib0003","doi-asserted-by":"crossref","first-page":"6047","DOI":"10.1109\/TIP.2023.3328224","article-title":"Changes to captions: an attentive network for remote sensing change captioning","volume":"32","author":"Chang","year":"2023","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113610_bib0004","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.109962","article-title":"Reparameterizing and dynamically quantizing image features for image generation","volume":"146","author":"Sun","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113610_bib0005","doi-asserted-by":"crossref","first-page":"5737","DOI":"10.1109\/TIP.2023.3323799","article-title":"Txt2Img-MHN: remote sensing image generation from text using modern Hopfield networks","volume":"32","author":"Xu","year":"2023","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113610_bib0006","doi-asserted-by":"crossref","DOI":"10.1016\/j.jfoodeng.2024.112134","article-title":"Fine grained food image recognition based on swin transformer","volume":"380","author":"Xiao","year":"2024","journal-title":"J. Food Eng."},{"key":"10.1016\/j.patcog.2026.113610_bib0007","doi-asserted-by":"crossref","first-page":"2572","DOI":"10.1109\/TIP.2024.3374211","article-title":"Convolution-enhanced bi-branch adaptive transformer with cross-task interaction for food category and ingredient recognition","volume":"33","author":"Liu","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113610_bib0008","doi-asserted-by":"crossref","first-page":"1285","DOI":"10.1109\/TIP.2024.3360899","article-title":"Synthesizing knowledge-enhanced features for real-world zero-shot food detection","volume":"33","author":"Zhou","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113610_bib0009","doi-asserted-by":"crossref","DOI":"10.1016\/j.tifs.2025.104877","article-title":"Food recommendation towards personalized wellbeing","volume":"156","author":"Qiao","year":"2025","journal-title":"Trends Food Sci. Technol."},{"issue":"8","key":"10.1016\/j.patcog.2026.113610_bib0010","doi-asserted-by":"crossref","first-page":"9932","DOI":"10.1109\/TPAMI.2023.3237871","article-title":"Large scale visual food recognition","volume":"45","author":"Min","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113610_bib0011","doi-asserted-by":"crossref","first-page":"2374","DOI":"10.1109\/TIP.2023.3267621","article-title":"Instance-level few-shot learning with class hierarchy mining","volume":"32","author":"Vu","year":"2023","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113610_bib0012","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"issue":"9","key":"10.1016\/j.patcog.2026.113610_bib0013","doi-asserted-by":"crossref","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","article-title":"Learning to prompt for vision-language models","volume":"130","author":"Zhou","year":"2022","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.113610_bib0014","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"16816","article-title":"Conditional prompt learning for vision-language models","author":"Zhou","year":"2022"},{"key":"10.1016\/j.patcog.2026.113610_bib0015","series-title":"International Conference on Machine Learning","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","author":"Jia","year":"2021"},{"key":"10.1016\/j.patcog.2026.113610_bib0016","series-title":"International Conference on Machine Learning","first-page":"12888","article-title":"Blip: bootstrapping language-image pre-training for unified vision-language understanding and generation","author":"Li","year":"2022"},{"key":"10.1016\/j.patcog.2026.113610_bib0017","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"21466","article-title":"Effective conditioned and composed image retrieval combining clip-based features","author":"Baldrati","year":"2022"},{"key":"10.1016\/j.patcog.2026.113610_bib0018","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"2765","article-title":"Clip for all things zero-shot sketch-based image retrieval, fine-grained or not","author":"Sain","year":"2023"},{"key":"10.1016\/j.patcog.2026.113610_bib0019","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"11686","article-title":"Cris: clip-driven referring image segmentation","author":"Wang","year":"2022"},{"key":"10.1016\/j.patcog.2026.113610_bib0020","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"7086","article-title":"Image segmentation using text and image prompts","author":"L\u00fcddecke","year":"2022"},{"key":"10.1016\/j.patcog.2026.113610_bib0021","series-title":"Findings of the Association for Computational Linguistics: EACL 2023","first-page":"1181","article-title":"Pubmedclip: how much does clip benefit visual question answering in the medical domain?","author":"Eslami","year":"2023"},{"key":"10.1016\/j.patcog.2026.113610_bib0022","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"19113","article-title":"Maple: multi-modal prompt learning","author":"Khattak","year":"2023"},{"key":"10.1016\/j.patcog.2026.113610_bib0023","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"15190","article-title":"Self-regulating prompts: foundational model adaptation without forgetting","author":"Khattak","year":"2023"},{"key":"10.1016\/j.patcog.2026.113610_bib0024","article-title":"DGPrompt: Dual-guidance prompts generation for vision-language models","author":"Zheng","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.patcog.2026.113610_bib0025","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"5206","article-title":"Prompt distribution learning","author":"Lu","year":"2022"},{"key":"10.1016\/j.patcog.2026.113610_bib0026","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"6757","article-title":"Visual-language prompt tuning with knowledge-guided context optimization","author":"Yao","year":"2023"},{"key":"10.1016\/j.patcog.2026.113610_bib0027","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"23438","article-title":"TCP: textual-based class-aware prompt tuning for visual-language model","author":"Yao","year":"2024"},{"key":"10.1016\/j.patcog.2026.113610_bib0028","series-title":"Proceedings of the Computer Vision and Pattern Recognition Conference","first-page":"29999","article-title":"Bayesian test-time adaptation for vision-language models","author":"Zhou","year":"2025"},{"key":"10.1016\/j.patcog.2026.113610_bib0029","series-title":"Proceedings of the International Conference on Learning Representations","article-title":"An image is worth 16x16 words: transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"key":"10.1016\/j.patcog.2026.113610_bib0030","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"770","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"key":"10.1016\/j.patcog.2026.113610_bib0031","series-title":"European Conference on Computer Vision","first-page":"310","article-title":"Long-clip: unlocking the long-text capability of clip","author":"Zhang","year":"2024"},{"issue":"189\u2013206","key":"10.1016\/j.patcog.2026.113610_bib0032","first-page":"1","article-title":"Extensions of Lipschitz mappings into a Hilbert space","volume":"26","author":"Johnson","year":"1984","journal-title":"Contemp. Math."},{"issue":"3","key":"10.1016\/j.patcog.2026.113610_bib0033","doi-asserted-by":"crossref","first-page":"319","DOI":"10.1016\/j.crma.2015.12.008","article-title":"A short proof of the Marchenko\u2013Pastur theorem","volume":"354","author":"Yaskov","year":"2016","journal-title":"C.R. Math."},{"key":"10.1016\/j.patcog.2026.113610_bib0034","doi-asserted-by":"crossref","first-page":"477","DOI":"10.1007\/s41095-020-0184-6","article-title":"A new dataset of dog breed images and a benchmark for finegrained classification","volume":"6","author":"Zou","year":"2020","journal-title":"Comput. Visual Media"},{"key":"10.1016\/j.patcog.2026.113610_bib0035","series-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3498","article-title":"Cats and dogs","author":"Parkhi","year":"2012"},{"key":"10.1016\/j.patcog.2026.113610_bib0036","series-title":"2008 Sixth Indian Conference on Computer Vision, Graphics & Image Processing","first-page":"722","article-title":"Automated flower classification over a large number of classes","author":"Nilsback","year":"2008"},{"key":"10.1016\/j.patcog.2026.113610_bib0037","series-title":"Proceedings of the IEEE International Conference on Computer Vision Workshops","first-page":"554","article-title":"3D object representations for fine-grained categorization","author":"Krause","year":"2013"},{"key":"10.1016\/j.patcog.2026.113610_bib0038","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"10602","article-title":"Webly supervised fine-grained recognition: benchmark datasets and an approach","author":"Sun","year":"2021"},{"key":"10.1016\/j.patcog.2026.113610_bib0039","series-title":"First Workshop on Fine-Grained Visual Categorization, IEEE Conference on Computer Vision and Pattern Recognition","article-title":"Novel dataset for fine-grained image categorization","author":"Khosla","year":"2011"},{"key":"10.1016\/j.patcog.2026.113610_bib0040","series-title":"CVPR09","article-title":"ImageNet: a large-scale hierarchical image database","author":"Deng","year":"2009"},{"key":"10.1016\/j.patcog.2026.113610_bib0041","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"541","article-title":"Vegfru: a domain-specific dataset for fine-grained visual categorization","author":"Hou","year":"2017"},{"key":"10.1016\/j.patcog.2026.113610_bib0042","unstructured":"C. Wah, S. Branson, P. Welinder, P. Perona, S. Belongie, The Caltech-UCSD Birds-200-2011 Dataset, 2011, (California Institute of Technology)."},{"key":"10.1016\/j.patcog.2026.113610_bib0043","series-title":"Computer Vision\u2013ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part VI 13","first-page":"446","article-title":"Food-101\u2013mining discriminative components with random forests","author":"Bossard","year":"2014"},{"key":"10.1016\/j.patcog.2026.113610_bib0044","series-title":"Proceedings of the 24th ACM International Conference on Multimedia","first-page":"32","article-title":"Deep-based ingredient recognition for cooking recipe retrieval","author":"Chen","year":"2016"},{"key":"10.1016\/j.patcog.2026.113610_bib0045","series-title":"Proceedings of the 27th ACM International Conference on Multimedia","first-page":"1331","article-title":"Ingredient-guided cascaded multi-attention network for food recognition","author":"Min","year":"2019"},{"key":"10.1016\/j.patcog.2026.113610_bib0046","series-title":"Proceedings of the 28th ACM International Conference on Multimedia","first-page":"393","article-title":"Isia food-500: a dataset for large-scale food recognition via stacked global-local attention network","author":"Min","year":"2020"},{"key":"10.1016\/j.patcog.2026.113610_bib0047","unstructured":"S. Maji, E. Rahtu, J. Kannala, M. Blaschko, A. Vedaldi, Fine-Grained Visual Classification of Aircraft, 2013, arXiv: 1306.5151\">arXiv: 1306.5151."},{"key":"10.1016\/j.patcog.2026.113610_bib0048","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"4230","article-title":"Learning to prompt with text only supervision for vision-language models","volume":"39","author":"Khattak","year":"2025"},{"key":"10.1016\/j.patcog.2026.113610_bib0049","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"3618","article-title":"Advancing textual prompt learning with anchored attributes","author":"Li","year":"2025"},{"key":"10.1016\/j.patcog.2026.113610_bib0050","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"618","article-title":"Grad-cam: visual explanations from deep networks via gradient-based localization","author":"Selvaraju","year":"2017"},{"key":"10.1016\/j.patcog.2026.113610_bib0051","series-title":"European Conference on Computer Vision","first-page":"709","article-title":"Visual prompt tuning","author":"Jia","year":"2022"},{"key":"10.1016\/j.patcog.2026.113610_bib0052","series-title":"European Conference on Computer Vision","first-page":"631","article-title":"Dualprompt: complementary prompting for rehearsal-free continual learning","author":"Wang","year":"2022"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326005753?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326005753?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,3]],"date-time":"2026-06-03T13:11:39Z","timestamp":1780492299000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326005753"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":52,"alternative-id":["S0031320326005753"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113610","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Structured-condensed prompt tuning in vision-language models for fine-grained image recognition","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113610","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113610"}}