{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,3]],"date-time":"2026-06-03T15:33:19Z","timestamp":1780500799621,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":77,"publisher":"ACM","funder":[{"name":"US. NIH","award":["R01GM134020"],"award-info":[{"award-number":["R01GM134020"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3754858","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T06:56:44Z","timestamp":1761375404000},"page":"2880-2889","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":11,"title":["Visual Instance-aware Prompt Tuning"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-0931-6982","authenticated-orcid":false,"given":"Xi","family":"Xiao","sequence":"first","affiliation":[{"name":"University of Alabama at Brimingham, Birmingham, AL, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-3092-5920","authenticated-orcid":false,"given":"Yunbei","family":"Zhang","sequence":"additional","affiliation":[{"name":"Tulane University, New Orleans, Louisiana, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8073-7552","authenticated-orcid":false,"given":"Xingjian","family":"Li","sequence":"additional","affiliation":[{"name":"Carnegie Mellon University, Pittsburgh, PA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3184-0566","authenticated-orcid":false,"given":"Tianyang","family":"Wang","sequence":"additional","affiliation":[{"name":"University of Alabama at Birmingham, Birmingham, Alabama, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6545-1943","authenticated-orcid":false,"given":"Xiao","family":"Wang","sequence":"additional","affiliation":[{"name":"Oak Ridge National Laboratory, Oak Ridge, TN, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6552-8912","authenticated-orcid":false,"given":"Yuxiang","family":"Wei","sequence":"additional","affiliation":[{"name":"Georgia Institute of Technology, Atlanta, GA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0680-0901","authenticated-orcid":false,"given":"Jihun","family":"Hamm","sequence":"additional","affiliation":[{"name":"Tulane University, New Orleans, Louisiana, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0881-5891","authenticated-orcid":false,"given":"Min","family":"Xu","sequence":"additional","affiliation":[{"name":"Carnegie Mellon University, Pittsburgh, PA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1038\/s42256-023-00711-8"},{"key":"e_1_3_2_1_2_1","volume-title":"Jamie Ryan Kiros, and Geoffrey E Hinton","author":"Ba Jimmy Lei","year":"2016","unstructured":"Jimmy Lei Ba, Jamie Ryan Kiros, and Geoffrey E Hinton. 2016. Layer normalization. arXiv preprint arXiv:1607.06450 (2016)."},{"key":"e_1_3_2_1_3_1","unstructured":"Hyojin Bahng Ali Jahanian Swami Sankaranarayanan and Phillip Isola. 2022. Exploring visual prompts for adapting large-scale models."},{"key":"e_1_3_2_1_4_1","volume-title":"Visual prompting: Modifying pixel space to adapt pre-trained models. arXiv preprint arXiv:2203.17274","author":"Bahng Hyojin","year":"2022","unstructured":"Hyojin Bahng, Ali Jahanian, Swami Sankaranarayanan, and Phillip Isola. 2022. Visual prompting: Modifying pixel space to adapt pre-trained models. arXiv preprint arXiv:2203.17274 (2022)."},{"key":"e_1_3_2_1_5_1","volume-title":"Conditional computation in neural networks for faster models. arXiv preprint arXiv:1511.06297","author":"Bengio Emmanuel","year":"2015","unstructured":"Emmanuel Bengio, Pierre-Luc Bacon, Joelle Pineau, and Doina Precup. 2015. Conditional computation in neural networks for faster models. arXiv preprint arXiv:1511.06297 (2015)."},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Lukas Bossard Matthieu Guillaumin and Luc Van Gool. 2014. Food-101--mining discriminative components with random forests. In ECCV.","DOI":"10.1007\/978-3-319-10599-4_29"},{"key":"e_1_3_2_1_7_1","volume-title":"Tinytl: Reduce memory, not parameters for efficient on-device learning.","author":"Cai Han","year":"2020","unstructured":"Han Cai, Chuang Gan, Ligeng Zhu, and Song Han. 2020. Tinytl: Reduce memory, not parameters for efficient on-device learning."},{"key":"e_1_3_2_1_8_1","volume-title":"Adaptformer: Adapting vision transformers for scalable visual recognition. arXiv preprint arXiv:2205.13535","author":"Chen Shoufa","year":"2022","unstructured":"Shoufa Chen, Chuang Ge, Zhiqiang Tong, Jianzhuang Wang, Yang Song, Jianmin Wang, and Ping Luo. 2022. Adaptformer: Adapting vision transformers for scalable visual recognition. arXiv preprint arXiv:2205.13535 (2022)."},{"key":"e_1_3_2_1_9_1","unstructured":"Xinlei Chen Haoqi Fan Ross Girshick and Kaiming He. 2020. Improved baselines with momentum contrastive learning."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"crossref","unstructured":"Xinlei Chen Saining Xie and Kaiming He. 2021. An empirical study of training self-supervised vision transformers.","DOI":"10.1109\/ICCV48922.2021.00950"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00413"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Mircea Cimpoi Subhransu Maji Iasonas Kokkinos Sammy Mohamed and Andrea Vedaldi. 2014. Describing textures in the wild. In CVPR.","DOI":"10.1109\/CVPR.2014.461"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Rahul Das Yahel Dukler Avinash Ravichandran and Ajay Swaminathan. 2023. Learning Expressive Prompting With Residuals for Vision Transformers. In CVPR.","DOI":"10.1109\/CVPR52729.2023.00328"},{"key":"e_1_3_2_1_14_1","volume-title":"Imagenet: A large-scale hierarchical image database. In CVPR.","author":"Deng Jia","year":"2009","unstructured":"Jia Deng,Wei Dong, Richard Socher, Li-Jia Li, Kai Li, and Li Fei-Fei. 2009. Imagenet: A large-scale hierarchical image database. In CVPR."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Shaohua Dong Yunhe Feng Qing Yang Yan Huang Dongfang Liu and Heng Fan. 2023. Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning.","DOI":"10.1109\/IROS58592.2024.10801872"},{"key":"e_1_3_2_1_16_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly et al. 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i16.29766"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"crossref","unstructured":"Cheng Han Qifan Wang Yiming Cui Zhiwen Cao Wenguan Wang Siyuan Qi and Dongfang Liu. 2023. E2vpt: An effective and efficient approach for visual prompt tuning.","DOI":"10.1109\/ICCV51070.2023.01604"},{"key":"e_1_3_2_1_19_1","volume-title":"An Effective and Efficient Approach for Visual Prompt Tuning. arXiv preprint arXiv:2307.13770","author":"Han Chunyuan","year":"2023","unstructured":"Chunyuan Han, Qi Wang, Yuxin Cui, Zhiqian Cao, Wenqing Wang, Shiyu Qi, and Ding Liu. 2023. E^ 2VPT: An Effective and Efficient Approach for Visual Prompt Tuning. arXiv preprint arXiv:2307.13770 (2023)."},{"key":"e_1_3_2_1_20_1","volume-title":"International Conference on Learning Representations (ICLR).","author":"Han Cheng","year":"2024","unstructured":"Cheng Han, QifanWang, Yiming Cui,WenguanWang, Lifu Huang, and Dongfang Liu. 2024. Facing the Elephant in the Room: Visual Prompt Tuning or Full Finetuning?. In International Conference on Learning Representations (ICLR)."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00548"},{"key":"e_1_3_2_1_22_1","unstructured":"Kaiming He Xinlei Chen Saining Xie Yanghao Li Piotr Doll\u00e1r and Ross Girshick. 2022. Masked autoencoders are scalable vision learners."},{"key":"e_1_3_2_1_23_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep residual learning for image recognition. In CVPR."},{"key":"e_1_3_2_1_24_1","unstructured":"Edward J Hu Yelong Shen Phillip Wallis Zeyuan Allen-Zhu Yuanzhi Li Shean Wang Lu Wang and Weizhu Chen. 2022. LoRA: Low-Rank Adaptation of Large Language Models. In ICLR."},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.243"},{"key":"e_1_3_2_1_26_1","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition.","author":"Huang Mingzhen","year":"2023","unstructured":"Mingzhen Huang, Jingru Zhang, Xiaodan Liang, and Hao Wang. 2023. DAM-VP: Adaptive Meta-Learning for Visual Prompt Tuning in Domain-Adaptive Vision Transformers. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition."},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01195"},{"key":"e_1_3_2_1_28_1","volume-title":"CIBR: Cross-modal Information Bottleneck Regularization for Robust CLIP Generalization. arXiv:2503.24182 [cs.CV] https:\/\/arxiv.org\/abs\/2503.24182","author":"Ji Yingrui","year":"2025","unstructured":"Yingrui Ji, Xi Xiao, Gaofei Chen, Hao Xu, Chenrui Ma, Lijing Zhu, Aokun Liang, and Jiansheng Chen. 2025. CIBR: Cross-modal Information Bottleneck Regularization for Robust CLIP Generalization. arXiv:2503.24182 [cs.CV] https:\/\/arxiv.org\/abs\/2503.24182"},{"key":"e_1_3_2_1_29_1","unstructured":"Menglin Jia Luming Tang Bor-Chun Chen Claire Cardie Serge Belongie Bharath Hariharan and Ser-Nam Lim. 2022. Visual prompt tuning. In ECCV."},{"key":"e_1_3_2_1_30_1","volume-title":"LoR-VP: Low-Rank Visual Prompting for Efficient Vision Model Adaptation. In The Thirteenth International Conference on Learning Representations.","author":"Jin Can","unstructured":"Can Jin, Ying Li, Mingyu Zhao, Shiyu Zhao, ZhentingWang, Xiaoxiao He, Ligong Han, Tong Che, and Dimitris N Metaxas. [n.d.]. LoR-VP: Low-Rank Visual Prompting for Efficient Vision Model Adaptation. In The Thirteenth International Conference on Learning Representations."},{"key":"e_1_3_2_1_31_1","volume-title":"Auto-Encoding Variational Bayes. arXiv preprint arXiv:1312.6114","author":"Kingma Diederik P","year":"2013","unstructured":"Diederik P Kingma and Max Welling. 2013. Auto-Encoding Variational Bayes. arXiv preprint arXiv:1312.6114 (2013)."},{"key":"e_1_3_2_1_32_1","volume-title":"Technical report","author":"Krizhevsky Alex","unstructured":"Alex Krizhevsky and Geoffrey Hinton. 2009. Learning multiple layers of features from tiny images. In Technical report, University of Toronto."},{"key":"e_1_3_2_1_33_1","volume-title":"The power of scale for parameter-efficient prompt tuning. arXiv preprint arXiv:2104.08691","author":"Lester Brian","year":"2021","unstructured":"Brian Lester, Rami Al-Rfou, and Noah Constant. 2021. The power of scale for parameter-efficient prompt tuning. arXiv preprint arXiv:2104.08691 (2021)."},{"key":"e_1_3_2_1_34_1","unstructured":"Hengjia Li Lifan Jiang Xi Xiao Tianyang Wang Hongwei Yi Boxi Wu and Deng Cai. 2025. MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization. arXiv preprint arXiv:2503.12689 (2025)."},{"key":"e_1_3_2_1_35_1","unstructured":"Hengjia Li Yang Liu Yibo Zhao Haoran Cheng Yang Yang Linxuan Xia Zekai Luo Qibo Qiu BoxiWu Tu Zheng et al. 2024. GCA-3D: Towards Generalized and Consistent Domain Adaptation of 3D Generators. arXiv preprint arXiv:2412.15491 (2024)."},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01368"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11630"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"crossref","unstructured":"Ze Liu Yutong Lin Yutong Cao Han Hu Yixuan Wei Zheng Zhang Stephen Lin and Baining Guo. 2021. Swin transformer: Hierarchical vision transformer using shifted windows. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681233"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01383"},{"key":"e_1_3_2_1_41_1","unstructured":"Yuval Netzer Tao Wang Adam Coates Alessandro Bissacco Bo Wu and Andrew Y Ng. 2011. Reading digits in natural images with unsupervised feature learning."},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICVGIP.2008.47"},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02320"},{"key":"e_1_3_2_1_44_1","unstructured":"Xiang Pei et al. 2024. SA2VP: Spatially Aware Visual Prompting for Fine-Grained Image Recognition. arXiv preprint arXiv:2401.01567 (2024)."},{"key":"e_1_3_2_1_45_1","volume-title":"Boosted prompt ensembles for large language models. arXiv preprint arXiv:2304.05970","author":"Pitis Silviu","year":"2023","unstructured":"Silviu Pitis, Michael R Zhang, Andrew Wang, and Jimmy Ba. 2023. Boosted prompt ensembles for large language models. arXiv preprint arXiv:2304.05970 (2023)."},{"key":"e_1_3_2_1_46_1","volume-title":"NeurIPS","volume":"30","author":"Rebuffi Sylvestre-Alvise","year":"2017","unstructured":"Sylvestre-Alvise Rebuffi, Hakan Bilen, and Andrea Vedaldi. 2017. Learning multiple visual domains with residual adapters. In NeurIPS, Vol. 30."},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00411"},{"key":"e_1_3_2_1_48_1","volume-title":"Chinese Conference on Pattern Recognition and Computer Vision (PRCV). Springer, 293--303","author":"Ruan Chunqing","year":"2023","unstructured":"Chunqing Ruan and Hongjian Wang. 2023. Dynamic visual prompt tuning for parameter efficient transfer learning. In Chinese Conference on Pattern Recognition and Computer Vision (PRCV). Springer, 293--303."},{"key":"e_1_3_2_1_49_1","volume-title":"Grad-cam: Visual explanations from deep networks via gradient-based localization. In ICCV.","author":"Selvaraju Ramprasaath R","year":"2017","unstructured":"Ramprasaath R Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh, and Dhruv Batra. 2017. Grad-cam: Visual explanations from deep networks via gradient-based localization. In ICCV."},{"key":"e_1_3_2_1_50_1","volume-title":"Test-Time Model Adaptation with Only Forward Passes. In The International Conference on Machine Learning.","author":"Pengcheng Wu Peilin Zhao Guohao Chen","year":"2024","unstructured":"Guohao Chen Pengcheng Wu Peilin Zhao Shuaicheng Niu, Chunyan Miao. 2024. Test-Time Model Adaptation with Only Forward Passes. In The International Conference on Machine Learning."},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"crossref","unstructured":"Johannes Stallkamp Marc Schlipsing Jan Salmen and Christian Igel. 2012. Man vs. computer: Benchmarking machine learning algorithms for traffic sign recognition. Neural networks 32 323--332.","DOI":"10.1016\/j.neunet.2012.02.016"},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00746"},{"key":"e_1_3_2_1_53_1","first-page":"11","article-title":"Visualizing data using t-sne","volume":"9","author":"der Maaten Laurens Van","year":"2008","unstructured":"Laurens Van der Maaten and Geoffrey Hinton. 2008. Visualizing data using t-sne. JMLR 9, 11.","journal-title":"JMLR"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298658"},{"key":"e_1_3_2_1_55_1","unstructured":"CatherineWah Steve Branson PeterWelinder Pietro Perona and Serge Belongie. 2011. The caltech-ucsd birds-200--2011 dataset."},{"key":"e_1_3_2_1_56_1","volume-title":"The Caltech-UCSD Birds-200--2011 Dataset","author":"Wah Catherine","unstructured":"Catherine Wah, Steve Branson, Peter Welinder, Pietro Perona, and Serge Belongie. 2011. The Caltech-UCSD Birds-200--2011 Dataset. In California Institute of Technology."},{"key":"e_1_3_2_1_57_1","volume-title":"Yiming Cui, Yuning Mao, Shaoliang Nie, Jiahao Liu, Fuli Feng, Zenglin Xu, Cheng Han, Lifu Huang, QifanWang, and Dongfang Liu.","author":"Wang Taowen","year":"2024","unstructured":"Taowen Wang, Yiyang Liu, James Chenhao Liang, junhan zhao, Yiming Cui, Yuning Mao, Shaoliang Nie, Jiahao Liu, Fuli Feng, Zenglin Xu, Cheng Han, Lifu Huang, QifanWang, and Dongfang Liu. 2024. M2PT: Multimodal Prompt Tuning for Zero-shot Instruction Learning. arXiv:2409.15657 [cs.AI] https:\/\/arxiv.org\/ abs\/2409.15657"},{"key":"e_1_3_2_1_58_1","volume-title":"FOCUS: Fused Observation of Channels for Unveiling Spectra. arXiv:2507.14787 [cs.CV] https:\/\/arxiv.org\/abs\/2507.14787","author":"Xiao Xi","year":"2025","unstructured":"Xi Xiao, Aristeidis Tsaris, Anika Tabassum, John Lagergren, Larry M. York, Tianyang Wang, and Xiao Wang. 2025. FOCUS: Fused Observation of Channels for Unveiling Spectra. arXiv:2507.14787 [cs.CV] https:\/\/arxiv.org\/abs\/2507.14787"},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-96-6585-3_24"},{"key":"e_1_3_2_1_60_1","unstructured":"Xi Xiao Yunbei Zhang Yanshuh Li Xingjian Li Tianyang Wang Jihun Hamm Xiao Wang and Min Xu. 2025. Visual Variational Autoencoder Prompt Tuning. arXiv:2503.17650 [cs.CV] https:\/\/arxiv.org\/abs\/2503.17650"},{"key":"e_1_3_2_1_61_1","volume-title":"Snoek","author":"Xiao Zehao","year":"2024","unstructured":"Zehao Xiao and Cees G. M. Snoek. 2024. Beyond Model Adaptation at Test Time: A Survey. arXiv:2411.03687 [cs.LG] https:\/\/arxiv.org\/abs\/2411.03687"},{"key":"e_1_3_2_1_62_1","unstructured":"Seungryong Yoo Eunji Kim Dahuin Jung Jungbeom Lee and Sungroh Yoon. 2023. Improving visual prompt tuning for self-supervised vision transformers."},{"key":"e_1_3_2_1_63_1","unstructured":"Jason Yosinski Jeff Clune Yoshua Bengio and Hod Lipson. 2014. Howtransferable are features in deep neural networks?"},{"key":"e_1_3_2_1_64_1","unstructured":"Tianshu Yu Min Yang and Xiaoyan Zhao. 2022. Dependency-aware Prototype Learning for Few-shot Relation Classification. In Proceedings of the 29th International Conference on Computational Linguistics Nicoletta Calzolari Chu-Ren Huang Hansaem Kim James Pustejovsky Leo Wanner Key-Sun Choi Pum-Mo Ryu Hsin-Hsi Chen Lucia Donatelli Heng Ji Sadao Kurohashi Patrizia Paggio Nianwen Xue Seokhwan Kim Younggyun Hahm Zhong He Tony Kyungil Lee Enrico Santus Francis Bond and Seung-Hoon Na (Eds.). International Committee on Computational Linguistics Gyeongju Republic of Korea 2339--2345. https:\/\/aclanthology.org\/2022.coling-1.205\/"},{"key":"e_1_3_2_1_65_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2024.107096"},{"key":"e_1_3_2_1_66_1","volume-title":"CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation. arXiv preprint arXiv:2506.23121","author":"Yu Xinlei","year":"2025","unstructured":"Xinlei Yu, Chanmiao Wang, Hui Jin, Ahmed Elazab, Gangyong Jia, Xiang Wan, Changqing Zou, and Ruiquan Ge. 2025. CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation. arXiv preprint arXiv:2506.23121 (2025)."},{"key":"e_1_3_2_1_67_1","unstructured":"Yuhang Zang Wei Li Kaiyang Zhou Chen Huang and Chen Change Loy. 2022. Unified vision and language prompt learning."},{"key":"e_1_3_2_1_68_1","first-page":"5552","article-title":"Visual fourier prompt tuning","volume":"37","author":"Zeng Runjia","year":"2024","unstructured":"Runjia Zeng, Cheng Han, Qifan Wang, Chunshu Wu, Tong Geng, Lifu Huangg, Ying Nian Wu, and Dongfang Liu. 2024. Visual fourier prompt tuning. Advances in Neural Information Processing Systems 37 (2024), 5552--5585.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_69_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01082"},{"key":"e_1_3_2_1_70_1","volume-title":"Mario Neumann, Alexey Dosovitskiy, et al.","author":"Zhai Xiaohua","year":"2019","unstructured":"Xiaohua Zhai, Joan Puigcerver, Alexander Kolesnikov, Pierre Ruyssen, Carlos Riquelme, Mario Lucic, Josip Djolonga, Alexandre Sablayrolles Pinto, Mario Neumann, Alexey Dosovitskiy, et al. 2019. A large-scale study of representation learning with the visual task adaptation benchmark. arXiv preprint arXiv:1910.04867."},{"key":"e_1_3_2_1_71_1","doi-asserted-by":"crossref","unstructured":"Jeffrey O Zhang Alexander Sax Amir Zamir Leonidas Guibas and Jitendra Malik. 2020. Side-tuning: a baseline for network adaptation via additive side networks.","DOI":"10.1007\/978-3-030-58580-8_41"},{"key":"e_1_3_2_1_72_1","doi-asserted-by":"publisher","DOI":"10.1109\/WACV61041.2025.00117"},{"key":"e_1_3_2_1_73_1","volume-title":"DPCore: Dynamic Prompt Coreset for Continual Test-Time Adaptation. In Forty-second International Conference on Machine Learning. https:\/\/openreview.net\/forum?id=A6zDim0rQf","author":"Zhang Yunbei","year":"2025","unstructured":"Yunbei Zhang, Akshay Mehra, Shuaicheng Niu, and Jihun Hamm. 2025. DPCore: Dynamic Prompt Coreset for Continual Test-Time Adaptation. In Forty-second International Conference on Machine Learning. https:\/\/openreview.net\/forum?id=A6zDim0rQf"},{"key":"e_1_3_2_1_74_1","unstructured":"Zangwei Zheng Xiangyu Yue Kai Wang and Yang You. 2022. Prompt Vision Transformer for Domain Generalization. arXiv:2208.08914 [cs.CV] https:\/\/arxiv.org\/abs\/2208.08914"},{"key":"e_1_3_2_1_75_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"e_1_3_2_1_76_1","volume-title":"Conditional Prompt Learning for Vision-Language Models. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Zhou Kaiyang","year":"2022","unstructured":"Kaiyang Zhou, Jingkang Yang, Chen Change Loy, and Ziwei Liu. 2022. Conditional Prompt Learning for Vision-Language Models. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_1_77_1","volume-title":"Proceedings of the IEEE\/CVF international conference on computer vision. 15659--15669","author":"Zhu Beier","year":"2023","unstructured":"Beier Zhu, Yulei Niu, Yucheng Han, YueWu, and Hanwang Zhang. 2023. Promptaligned gradient for prompt tuning. In Proceedings of the IEEE\/CVF international conference on computer vision. 15659--15669."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3754858","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,9]],"date-time":"2025-12-09T19:33:58Z","timestamp":1765308838000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3754858"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":77,"alternative-id":["10.1145\/3746027.3754858","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3754858","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}