{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T20:04:46Z","timestamp":1784145886345,"version":"3.55.0"},"reference-count":46,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62176252"],"award-info":[{"award-number":["62176252"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Sciences"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.ins.2026.123849","type":"journal-article","created":{"date-parts":[[2026,6,29]],"date-time":"2026-06-29T15:26:51Z","timestamp":1782746811000},"page":"123849","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Multi-modal prompt codebook learning: Achieving adaptive and generalizable prompting for CLIP-based visual recognition"],"prefix":"10.1016","volume":"756","author":[{"given":"Geyuan","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaofei","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gaopeng","family":"Gou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gang","family":"Xiong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Li","family":"Guo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.ins.2026.123849_bib0005","series-title":"Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18\u201324 July 2021, Virtual Event, 139, Proceedings of Machine Learning Research","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","author":"Jia","year":"2021"},{"key":"10.1016\/j.ins.2026.123849_bib0010","series-title":"Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18\u201324 July 2021, Virtual Event, 139, Proceedings of Machine Learning Research","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"issue":"2","key":"10.1016\/j.ins.2026.123849_bib0015","doi-asserted-by":"crossref","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","article-title":"CLIP-adapter: better vision-language models with feature adapters","volume":"132","author":"Gao","year":"2024","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.ins.2026.123849_bib0020","series-title":"The Tenth International Conference on Learning Representations, ICLR 2022, Virtual Event, April 25\u201329, 2022","article-title":"Open-vocabulary object detection via vision and language knowledge distillation","author":"Gu","year":"2022"},{"key":"10.1016\/j.ins.2026.123849_bib0025","series-title":"Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XXX, 12375, Lecture Notes in Computer Science","first-page":"121","article-title":"Oscar: object-semantics aligned pre-training for vision-language tasks","author":"Li","year":"2020"},{"key":"10.1016\/j.ins.2026.123849_bib0030","series-title":"International Conference on Machine Learning, ICML 2022, 17\u201323 July 2022, Baltimore, Maryland, USA, 162, Proceedings of Machine Learning Research","first-page":"12888","article-title":"BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation","author":"Li","year":"2022"},{"key":"10.1016\/j.ins.2026.123849_bib0035","series-title":"The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1\u20135, 2023","article-title":"PLOT: prompt learning with optimal transport for vision-language models","author":"Chen","year":"2023"},{"key":"10.1016\/j.ins.2026.123849_bib0040","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2022, New Orleans, LA, USA, June 18\u201324, 2022","first-page":"5196","article-title":"Prompt distribution learning","author":"Lu","year":"2022"},{"key":"10.1016\/j.ins.2026.123849_bib0045","doi-asserted-by":"crossref","first-page":"14274","DOI":"10.52202\/068431-1038","article-title":"Test-time prompt tuning for zero-shot generalization in vision-language models","volume":"35","author":"Shu","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.ins.2026.123849_bib0050","author":"Zhou"},{"key":"10.1016\/j.ins.2026.123849_bib0055","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2023, Vancouver, BC, Canada, June 17\u201324, 2023","first-page":"19113","article-title":"MaPLe: multi-modal prompt learning","author":"Khattak","year":"2023"},{"key":"10.1016\/j.ins.2026.123849_bib0060","series-title":"IEEE\/CVF International Conference on Computer Vision, ICCV 2023, Paris, France, October 1\u20136, 2023","first-page":"15144","article-title":"Self-regulating prompts: foundational model adaptation without forgetting","author":"Khattak","year":"2023"},{"key":"10.1016\/j.ins.2026.123849_bib0065","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2022, New Orleans, LA, USA, June 18\u201324, 2022","first-page":"16795","article-title":"Conditional prompt learning for vision-language models","author":"Zhou","year":"2022"},{"key":"10.1016\/j.ins.2026.123849_bib0070","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, WA, USA, June 16\u201322, 2024","first-page":"23438","article-title":"TCP: textual-based class-aware prompt tuning for visual-language model","author":"Yao","year":"2024"},{"key":"10.1016\/j.ins.2026.123849_bib0075","series-title":"IEEE\/CVF International Conference on Computer Vision, ICCV 2023, Paris, France, October 1\u20136, 2023","first-page":"22133","article-title":"A retrospect to multi-prompt learning across vision and language","author":"Chen","year":"2023"},{"key":"10.1016\/j.ins.2026.123849_bib0080","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia, MM 2024, Melbourne, VIC, Australia, 28 October 2024 - 1 November 2024","first-page":"2729","article-title":"CP-prompt: composition-based cross-modal prompting for domain-incremental continual learning","author":"Feng","year":"2024"},{"issue":"6","key":"10.1016\/j.ins.2026.123849_bib0085","doi-asserted-by":"crossref","first-page":"1169","DOI":"10.1007\/s41095-023-0389-6","article-title":"Learning to compose diversified prompts for image emotion classification","volume":"10","author":"Deng","year":"2024","journal-title":"Comput. Vis. Media"},{"key":"10.1016\/j.ins.2026.123849_bib0090","series-title":"Advances in Neural Information Processing Systems 35: Annual Conference on Neural Information Processing Systems 2022, NeurIPS 2022, New Orleans, LA, USA, November 28 - December 9, 2022","article-title":"S-Prompts learning with pre-trained transformers: an occam\u2019s razor for domain incremental learning","author":"Wang","year":"2022"},{"key":"10.1016\/j.ins.2026.123849_bib0095","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2022, New Orleans, LA, USA, June 18\u201324, 2022","first-page":"18102","article-title":"LiT: zero-shot transfer with locked-image text tuning","author":"Zhai","year":"2022"},{"key":"10.1016\/j.ins.2026.123849_bib0100","series-title":"International Conference on Machine Learning, ICML 2023, 23\u201329 July 2023, Honolulu, Hawaii, USA, 202, Proceedings of Machine Learning Research","first-page":"19730","article-title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.ins.2026.123849_bib0105","series-title":"The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1\u20135, 2023","article-title":"PaLI: a jointly-scaled multilingual language-image model","author":"Chen","year":"2023"},{"key":"10.1016\/j.ins.2026.123849_bib0110","author":"Khattak"},{"key":"10.1016\/j.ins.2026.123849_bib0115","author":"Liu"},{"key":"10.1016\/j.ins.2026.123849_bib0120","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107472","article-title":"DGPrompt: dual-guidance prompts generation for vision-language models","volume":"188","author":"Zheng","year":"2025","journal-title":"Neural Netw."},{"key":"10.1016\/j.ins.2026.123849_bib0125","author":"Zheng"},{"key":"10.1016\/j.ins.2026.123849_bib0130","author":"Bengio"},{"key":"10.1016\/j.ins.2026.123849_bib0135","series-title":"2009 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR 2009), 20\u201325 June 2009, Miami, Florida, USA","first-page":"248","article-title":"ImageNet: a large-scale hierarchical image database","author":"Deng","year":"2009"},{"issue":"7","key":"10.1016\/j.ins.2026.123849_bib0140","doi-asserted-by":"crossref","first-page":"2217","DOI":"10.1109\/JSTARS.2019.2918242","article-title":"EuroSAT: a novel dataset and deep learning benchmark for land use and land cover classification","volume":"12","author":"Helber","year":"2019","journal-title":"IEEE J. Sel. Top. Appl. Earth Obs. Remote. Sens."},{"key":"10.1016\/j.ins.2026.123849_bib0145","series-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3498","article-title":"Cats and dogs","author":"Parkhi","year":"2012"},{"key":"10.1016\/j.ins.2026.123849_bib0150","series-title":"2014 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2014, Columbus, OH, USA, June 23\u201328, 2014","first-page":"3606","article-title":"Describing textures in the wild","author":"Cimpoi","year":"2014"},{"key":"10.1016\/j.ins.2026.123849_bib0155","series-title":"The Twenty-Third IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2010, San Francisco, CA, USA, 13\u201318 June 2010","first-page":"3485","article-title":"SUN database: large-scale scene recognition from abbey to zoo","author":"Xiao","year":"2010"},{"issue":"1","key":"10.1016\/j.ins.2026.123849_bib0160","doi-asserted-by":"crossref","first-page":"59","DOI":"10.1016\/j.cviu.2005.09.012","article-title":"Learning generative visual models from few training examples: an incremental Bayesian approach tested on 101 object categories","volume":"106","author":"Fei-Fei","year":"2007","journal-title":"Comput. Vis. Image Underst."},{"key":"10.1016\/j.ins.2026.123849_bib0165","series-title":"Computer Vision - ECCV 2014 - 13th European Conference, Zurich, Switzerland, September 6\u201312, 2014, Proceedings, Part VI, 8694, Lecture Notes in Computer Science","first-page":"446","article-title":"Food-101 - mining discriminative components with random forests","author":"Bossard","year":"2014"},{"key":"10.1016\/j.ins.2026.123849_bib0170","author":"Maji"},{"key":"10.1016\/j.ins.2026.123849_bib0175","author":"Soomro"},{"key":"10.1016\/j.ins.2026.123849_bib0180","series-title":"2013 IEEE International Conference on Computer Vision Workshops, ICCV Workshops 2013, Sydney, Australia, December 1\u20138, 2013","first-page":"554","article-title":"3D object representations for fine-grained categorization","author":"Krause","year":"2013"},{"key":"10.1016\/j.ins.2026.123849_bib0185","series-title":"Sixth Indian Conference on Computer Vision, Graphics & Image Processing, ICVGIP 2008, Bhubaneswar, India, 16\u201319 December 2008","first-page":"722","article-title":"Automated flower classification over a large number of classes","author":"Nilsback","year":"2008"},{"key":"10.1016\/j.ins.2026.123849_bib0190","series-title":"Advances in Neural Information Processing Systems 32: Annual Conference on Neural Information Processing Systems 2019, NeurIPS 2019, December 8\u201314, 2019, Vancouver, BC, Canada","first-page":"10506","article-title":"Learning robust global representations by penalizing local predictive power","author":"Wang","year":"2019"},{"key":"10.1016\/j.ins.2026.123849_bib0195","series-title":"Proceedings of the 36th International Conference on Machine Learning, ICML 2019, 9\u201315 June 2019, Long Beach, California, USA, 97, Proceedings of Machine Learning Research","first-page":"5389","article-title":"Do ImageNet classifiers generalize to ImageNet?","author":"Recht","year":"2019"},{"key":"10.1016\/j.ins.2026.123849_bib0200","series-title":"2021 IEEE\/CVF International Conference on Computer Vision, ICCV 2021, Montreal, QC, Canada, October 10\u201317, 2021","first-page":"8320","article-title":"The many faces of robustness: a critical analysis of out-of-distribution generalization","author":"Hendrycks","year":"2021"},{"key":"10.1016\/j.ins.2026.123849_bib0205","series-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2021, virtual, June 19\u201325, 2021","first-page":"15262","article-title":"Natural adversarial examples","author":"Hendrycks","year":"2021"},{"key":"10.1016\/j.ins.2026.123849_bib0210","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2023, Vancouver, BC, Canada, June 17\u201324, 2023","first-page":"6757","article-title":"Visual-language prompt tuning with knowledge-guided context optimization","author":"Yao","year":"2023"},{"key":"10.1016\/j.ins.2026.123849_bib0215","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, WA, USA, June 16\u201322, 2024","first-page":"12924","article-title":"DePT: decoupled prompt tuning","author":"Zhang","year":"2024"},{"key":"10.1016\/j.ins.2026.123849_bib0220","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV)","first-page":"3618","article-title":"Advancing textual prompt learning with anchored attributes","author":"Li","year":"2025"},{"key":"10.1016\/j.ins.2026.123849_bib0225","series-title":"9th International Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, May 3\u20137, 2021","article-title":"An image is worth 16x16 words: transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"issue":"2","key":"10.1016\/j.ins.2026.123849_bib0230","doi-asserted-by":"crossref","first-page":"336","DOI":"10.1007\/s11263-019-01228-7","article-title":"Grad-CAM: visual explanations from deep networks via gradient-based localization","volume":"128","author":"Selvaraju","year":"2019","journal-title":"Int. J. Comput. Vis."}],"container-title":["Information Sciences"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0020025526007802?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0020025526007802?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T19:39:51Z","timestamp":1784144391000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0020025526007802"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":46,"alternative-id":["S0020025526007802"],"URL":"https:\/\/doi.org\/10.1016\/j.ins.2026.123849","relation":{},"ISSN":["0020-0255"],"issn-type":[{"value":"0020-0255","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Multi-modal prompt codebook learning: Achieving adaptive and generalizable prompting for CLIP-based visual recognition","name":"articletitle","label":"Article Title"},{"value":"Information Sciences","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.ins.2026.123849","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Published by Elsevier Inc.","name":"copyright","label":"Copyright"}],"article-number":"123849"}}