{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T21:18:24Z","timestamp":1783113504743,"version":"3.54.6"},"reference-count":52,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62006098"],"award-info":[{"award-number":["62006098"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002858","name":"China Postdoctoral Science Foundation","doi-asserted-by":"publisher","award":["2020M681515"],"award-info":[{"award-number":["2020M681515"]}],"id":[{"id":"10.13039\/501100002858","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Sciences"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.ins.2026.123707","type":"journal-article","created":{"date-parts":[[2026,5,30]],"date-time":"2026-05-30T05:21:33Z","timestamp":1780118493000},"page":"123707","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Attribute-calibrated local embeddings for prompt learning in vision-language models"],"prefix":"10.1016","volume":"754","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7432-6914","authenticated-orcid":false,"given":"Zhongchen","family":"Ma","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-1268-5948","authenticated-orcid":false,"given":"Jiahao","family":"Song","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-2113-0110","authenticated-orcid":false,"given":"Xingchen","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yintong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lijian","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.ins.2026.123707_bib0005","doi-asserted-by":"crossref","DOI":"10.1016\/j.future.2026.108559","article-title":"Exploiting attention-driven weather-aware multimodal spatio-temporal fusion for urban traffic flow prediction","author":"Ali","year":"2026","journal-title":"Future Gener. Comput. Syst."},{"key":"10.1016\/j.ins.2026.123707_bib0010","doi-asserted-by":"crossref","first-page":"22465","DOI":"10.1021\/acs.iecr.5c02759","article-title":"Hybrid fusion paradigm in advanced process monitoring: a panoramic review and future perspectives","volume":"64","author":"Ali","year":"2025","journal-title":"Ind. Eng. Chem. Res."},{"key":"10.1016\/j.ins.2026.123707_bib0015","doi-asserted-by":"crossref","DOI":"10.1088\/2632-2153\/ada088","article-title":"A novel dynamic machine learning-based explainable fusion monitoring: application to industrial and chemical processes","volume":"6","author":"Ali","year":"2025","journal-title":"Mach. Learn. Sci. Technol."},{"key":"10.1016\/j.ins.2026.123707_bib0020","author":"Amir"},{"key":"10.1016\/j.ins.2026.123707_bib0025","series-title":"European Conference on Computer Vision","first-page":"446","article-title":"Food-101\u2013mining discriminative components with random forests","author":"Bossard","year":"2014"},{"key":"10.1016\/j.ins.2026.123707_bib0030","author":"Chen"},{"key":"10.1016\/j.ins.2026.123707_bib0035","author":"Cheng"},{"key":"10.1016\/j.ins.2026.123707_bib0040","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3606","article-title":"Describing textures in the wild","author":"Cimpoi","year":"2014"},{"key":"10.1016\/j.ins.2026.123707_bib0045","series-title":"2009 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"248","article-title":"Imagenet: a large-scale hierarchical image database","author":"Deng","year":"2009"},{"key":"10.1016\/j.ins.2026.123707_bib0050","series-title":"International Conference on Learning Representations","first-page":"50495","article-title":"Tree of attributes prompt learning for vision-language models","author":"Ding","year":"2025"},{"key":"10.1016\/j.ins.2026.123707_bib0055","series-title":"2004 Conference on Computer Vision and Pattern Recognition Workshop","first-page":"178","article-title":"Learning generative visual models from few training examples: an incremental Bayesian approach tested on 101 object categories","author":"Fei-Fei","year":"2004"},{"key":"10.1016\/j.ins.2026.123707_bib0060","doi-asserted-by":"crossref","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","article-title":"Clip-adapter: better vision-language models with feature adapters","volume":"132","author":"Gao","year":"2024","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.ins.2026.123707_bib0065","series-title":"Proceedings of the Computer Vision and Pattern Recognition Conference","first-page":"25015","article-title":"Mmrl: multi-modal representation learning for vision-language models","author":"Guo","year":"2025"},{"key":"10.1016\/j.ins.2026.123707_bib0070","doi-asserted-by":"crossref","first-page":"2217","DOI":"10.1109\/JSTARS.2019.2918242","article-title":"Eurosat: a novel dataset and deep learning benchmark for land use and land cover classification","volume":"12","author":"Helber","year":"2019","journal-title":"IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens."},{"key":"10.1016\/j.ins.2026.123707_bib0075","doi-asserted-by":"crossref","DOI":"10.1016\/j.jvcir.2023.103755","article-title":"Hierarchical attention vision transformer for fine-grained visual classification","volume":"91","author":"Hu","year":"2023","journal-title":"J. Vis. Commun. Image Represent."},{"key":"10.1016\/j.ins.2026.123707_bib0080","series-title":"International Conference on Machine Learning","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","author":"Jia","year":"2021"},{"key":"10.1016\/j.ins.2026.123707_bib0085","series-title":"European Conference on Computer Vision","first-page":"709","article-title":"Visual prompt tuning","author":"Jia","year":"2022"},{"key":"10.1016\/j.ins.2026.123707_bib0090","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107211","article-title":"Combining various training and adaptation algorithms for ensemble few-shot classification","volume":"185","author":"Jiang","year":"2025","journal-title":"Neural Netw."},{"key":"10.1016\/j.ins.2026.123707_bib0095","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"19113","article-title":"Maple: multi-modal prompt learning","author":"Khattak","year":"2023"},{"key":"10.1016\/j.ins.2026.123707_bib0100","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"15190","article-title":"Self-regulating prompts: foundational model adaptation without forgetting","author":"Khattak","year":"2023"},{"key":"10.1016\/j.ins.2026.123707_bib0105","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"1572","article-title":"Aapl: adding attributes to prompt learning for vision-language models","author":"Kim","year":"2024"},{"key":"10.1016\/j.ins.2026.123707_bib0110","series-title":"Proceedings of the IEEE International Conference on Computer Vision Workshops","first-page":"554","article-title":"3D object representations for fine-grained categorization","author":"Krause","year":"2013"},{"key":"10.1016\/j.ins.2026.123707_bib0115","series-title":"European Conference on Computer Vision","first-page":"264","article-title":"Gallop: learning global and local prompts for vision-language models","author":"Lafon","year":"2024"},{"key":"10.1016\/j.ins.2026.123707_bib0120","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"13733","article-title":"Evcap: retrieval-augmented image captioning with external visual-name memory for open-world comprehension","author":"Li","year":"2024"},{"key":"10.1016\/j.ins.2026.123707_bib0125","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"5206","article-title":"Prompt distribution learning","author":"Lu","year":"2022"},{"key":"10.1016\/j.ins.2026.123707_bib0130","series-title":"ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"4686","article-title":"MemoryPrompt: memory-augmented multi-layer prompting for vision-language models","author":"Ma","year":"2026"},{"key":"10.1016\/j.ins.2026.123707_bib0135","author":"Maji"},{"key":"10.1016\/j.ins.2026.123707_bib0140","doi-asserted-by":"crossref","first-page":"76298","DOI":"10.52202\/075280-3335","article-title":"Locoop: few-shot out-of-distribution detection via prompt learning","volume":"36","author":"Miyai","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.ins.2026.123707_bib0145","series-title":"2008 Sixth Indian Conference on Computer Vision, Graphics & Image Processing","first-page":"722","article-title":"Automated flower classification over a large number of classes","author":"Nilsback","year":"2008"},{"key":"10.1016\/j.ins.2026.123707_bib0150","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"1562","article-title":"Enhancing visual question answering through question-driven image captions as prompts","author":"\u00d6zdemir","year":"2024"},{"key":"10.1016\/j.ins.2026.123707_bib0155","series-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3498","article-title":"Cats and dogs","author":"Parkhi","year":"2012"},{"key":"10.1016\/j.ins.2026.123707_bib0160","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.ins.2026.123707_bib0165","first-page":"12116","article-title":"Do vision transformers see like convolutional neural networks?","volume":"34","author":"Raghu","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.ins.2026.123707_bib0170","doi-asserted-by":"crossref","first-page":"7397","DOI":"10.1109\/TVCG.2024.3456213","article-title":"Expressive 3D facial animation generation based on local-to-global latent diffusion","volume":"30","author":"Song","year":"2024","journal-title":"IEEE Trans. Vis. Comput. Graph."},{"key":"10.1016\/j.ins.2026.123707_bib0175","author":"Soomro"},{"key":"10.1016\/j.ins.2026.123707_bib0180","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"28578","article-title":"Argue: attribute-guided prompt tuning for vision-language models","author":"Tian","year":"2024"},{"key":"10.1016\/j.ins.2026.123707_bib0185","doi-asserted-by":"crossref","DOI":"10.1002\/aisy.202200131","article-title":"TASTA: text-assisted spatial and temporal attention network for video question answering","volume":"5","author":"Wang","year":"2023","journal-title":"Adv. Intell. Syst."},{"key":"10.1016\/j.ins.2026.123707_bib0190","author":"Wang"},{"key":"10.1016\/j.ins.2026.123707_bib0195","series-title":"European Conference on Computer Vision","first-page":"631","article-title":"Dualprompt: complementary prompting for rehearsal-free continual learning","author":"Wang","year":"2022"},{"issue":"4","key":"10.1016\/j.ins.2026.123707_bib0200","doi-asserted-by":"crossref","first-page":"1803","DOI":"10.1109\/TCYB.2026.3662418","article-title":"Test-time few-shot object detection via dynamic prototype fusion","volume":"56","author":"Wu","year":"2026","journal-title":"IEEE Trans. Cybern."},{"key":"10.1016\/j.ins.2026.123707_bib0205","series-title":"2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition","first-page":"3485","article-title":"Sun database: large-scale scene recognition from abbey to zoo","author":"Xiao","year":"2010"},{"key":"10.1016\/j.ins.2026.123707_bib0210","series-title":"Proceedings of the Computer Vision and Pattern Recognition Conference","first-page":"24884","article-title":"Flair: VLM with fine-grained language-informed image representations","author":"Xiao","year":"2025"},{"key":"10.1016\/j.ins.2026.123707_bib0215","doi-asserted-by":"crossref","first-page":"3746","DOI":"10.1007\/s11263-025-02354-1","article-title":"Learning with enriched inductive biases for vision-language models","volume":"133","author":"Yang","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.ins.2026.123707_bib0220","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"23826","article-title":"Mma: multi-modal adapter for vision-language models","author":"Yang","year":"2024"},{"key":"10.1016\/j.ins.2026.123707_bib0225","author":"Zang"},{"key":"10.1016\/j.ins.2026.123707_bib0230","series-title":"International Conference on Neural Information Processing","first-page":"274","article-title":"Boosting open-vocabulary object detection by handling background samples","author":"Zeng","year":"2025"},{"key":"10.1016\/j.ins.2026.123707_bib0235","series-title":"European Conference on Computer Vision","first-page":"493","article-title":"Tip-adapter: training-free adaption of clip for few-shot classification","author":"Zhang","year":"2022"},{"issue":"12","key":"10.1016\/j.ins.2026.123707_bib0240","doi-asserted-by":"crossref","first-page":"15765","DOI":"10.1109\/TCOMM.2025.3611710","article-title":"Zero-shot automatic modulation recognition using a large vision-language model","volume":"73","author":"Zhao","year":"2025","journal-title":"IEEE Trans. Commun."},{"key":"10.1016\/j.ins.2026.123707_bib0245","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"1891","article-title":"Hierarchical cross-modal prompt learning for vision-language models","author":"Zheng","year":"2025"},{"key":"10.1016\/j.ins.2026.123707_bib0250","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"28453","article-title":"Large language models are good prompt learners for low-shot image classification","author":"Zheng","year":"2024"},{"key":"10.1016\/j.ins.2026.123707_bib0255","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"16816","article-title":"Conditional prompt learning for vision-language models","author":"Zhou","year":"2022"},{"key":"10.1016\/j.ins.2026.123707_bib0260","doi-asserted-by":"crossref","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","article-title":"Learning to prompt for vision-language models","volume":"130","author":"Zhou","year":"2022","journal-title":"Int. J. Comput. Vis."}],"container-title":["Information Sciences"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0020025526006389?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0020025526006389?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T20:34:34Z","timestamp":1783110874000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0020025526006389"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":52,"alternative-id":["S0020025526006389"],"URL":"https:\/\/doi.org\/10.1016\/j.ins.2026.123707","relation":{},"ISSN":["0020-0255"],"issn-type":[{"value":"0020-0255","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Attribute-calibrated local embeddings for prompt learning in vision-language models","name":"articletitle","label":"Article Title"},{"value":"Information Sciences","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.ins.2026.123707","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Inc. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"123707"}}