{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T09:24:33Z","timestamp":1778059473602,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":36,"publisher":"ACM","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272438"],"award-info":[{"award-number":["62272438"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Beijing Natural Science Foundation","award":["L25700"],"award-info":[{"award-number":["L25700"]}]},{"name":"Fundamental Research Funds for Central Universities","award":["E2ET1104"],"award-info":[{"award-number":["E2ET1104"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3754581","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T06:47:18Z","timestamp":1761374838000},"page":"5413-5421","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["SDVPT: Semantic-Driven Visual Prompt Tuning for Open-world Object Counting"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0747-8598","authenticated-orcid":false,"given":"Yiming","family":"Zhao","sequence":"first","affiliation":[{"name":"University of the Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3954-2387","authenticated-orcid":false,"given":"Guorong","family":"Li","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9923-5034","authenticated-orcid":false,"given":"Laiyun","family":"Qing","sequence":"additional","affiliation":[{"name":"University of the Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5988-5494","authenticated-orcid":false,"given":"Amin","family":"Beheshti","sequence":"additional","affiliation":[{"name":"Macquarie University, Sydney, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4408-1952","authenticated-orcid":false,"given":"Jian","family":"Yang","sequence":"additional","affiliation":[{"name":"Macquarie University, Sydney, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3326-4147","authenticated-orcid":false,"given":"Quan Z.","family":"Sheng","sequence":"additional","affiliation":[{"name":"Macquarie University, Sydney, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4312-5682","authenticated-orcid":false,"given":"Yuankai","family":"Qi","sequence":"additional","affiliation":[{"name":"Macquarie University, Sydney, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7542-296X","authenticated-orcid":false,"given":"Qingming","family":"Huang","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Niki Amini-Naieni Kiana Amini-Naieni Tengda Han and Andrew Zisserman. 2023. Open-world Text-specifed Object Counting. In BMVC. 510."},{"key":"e_1_3_2_1_2_1","volume-title":"CountGD: Multi-modal open-world counting. NeurIPS","author":"Amini-Naieni Niki","year":"2024","unstructured":"Niki Amini-Naieni, Tengda Han, and Andrew Zisserman. 2024. CountGD: Multi-modal open-world counting. NeurIPS (2024), 48810-48837."},{"key":"e_1_3_2_1_3_1","first-page":"483","article-title":"Counting in the wild","author":"Arteta Carlos","year":"2016","unstructured":"Carlos Arteta, Victor Lempitsky, and Andrew Zisserman. 2016. Counting in the wild. In ECCV. 483-498.","journal-title":"ECCV."},{"key":"e_1_3_2_1_4_1","first-page":"640","article-title":"Crowdnet: A deep convolutional network for dense crowd counting","author":"Boominathan Lokesh","year":"2016","unstructured":"Lokesh Boominathan, Srinivas SS Kruthiventi, and R Venkatesh Babu. 2016. Crowdnet: A deep convolutional network for dense crowd counting. In ACM MM. 640-644.","journal-title":"ACM MM."},{"key":"e_1_3_2_1_5_1","first-page":"1","article-title":"Privacy preserving crowd monitoring: Counting people without people models or tracking","author":"Chan Antoni B","year":"2008","unstructured":"Antoni B Chan, Zhang-Sheng John Liang, and Nuno Vasconcelos. 2008. Privacy preserving crowd monitoring: Counting people without people models or tracking. In CVPR. 1-7.","journal-title":"CVPR."},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i1.25124"},{"key":"e_1_3_2_1_7_1","first-page":"18872","article-title":"A Low-Shot Object Counting Network With Iterative Prototype Adaptation","author":"Djukic Nikola","year":"2023","unstructured":"Nikola Djukic, Alan Lukezic, Vitjan Zavrtanik, and Matej Kristan. 2023. A Low-Shot Object Counting Network With Iterative Prototype Adaptation. In ICCV. 18872-18881.","journal-title":"ICCV."},{"key":"e_1_3_2_1_8_1","volume-title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR","author":"Dosovitskiy Alexey","year":"2021","unstructured":"Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR (2021)."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i6.25922"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i16.29766"},{"key":"e_1_3_2_1_11_1","first-page":"4145","article-title":"Drone-based object counting by spatially regularized regional proposal network","author":"Hsieh Meng-Ru","year":"2017","unstructured":"Meng-Ru Hsieh, Yen-Liang Lin, and Winston H Hsu. 2017. Drone-based object counting by spatially regularized regional proposal network. In ICCV. 4145-4153.","journal-title":"ICCV."},{"key":"e_1_3_2_1_12_1","first-page":"709","article-title":"Visual prompt tuning","author":"Jia Menglin","year":"2022","unstructured":"Menglin Jia, Luming Tang, Bor-Chun Chen, Claire Cardie, Serge Belongie, Bharath Hariharan, and Ser-Nam Lim. 2022. Visual prompt tuning. In ECCV. 709-727.","journal-title":"ECCV."},{"key":"e_1_3_2_1_13_1","first-page":"4535","article-title":"Clip-count: Towards text-guided zero-shot object counting","author":"Jiang Ruixiang","year":"2023","unstructured":"Ruixiang Jiang, Lingbo Liu, and Changwen Chen. 2023. Clip-count: Towards text-guided zero-shot object counting. In ACM MM. 4535-4545.","journal-title":"ACM MM."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i3.28050"},{"key":"e_1_3_2_1_15_1","volume-title":"Learning to count objects in images. NeurIPS","author":"Lempitsky Victor","year":"2010","unstructured":"Victor Lempitsky and Andrew Zisserman. 2010. Learning to count objects in images. NeurIPS (2010), 1324-1332."},{"key":"e_1_3_2_1_16_1","first-page":"38","article-title":"An end-to-end transformer model for crowd localization","author":"Liang Dingkang","year":"2022","unstructured":"Dingkang Liang, Wei Xu, and Xiang Bai. 2022. An end-to-end transformer model for crowd localization. In ECCV. 38-54.","journal-title":"ECCV."},{"key":"e_1_3_2_1_17_1","unstructured":"Wei Lin Kunlin Yang Xinzhu Ma Junyu Gao Lingbo Liu Shinan Liu Jun Hou Shuai Yi and Antoni Chan. 2022. Scale-Prior Deformable Convolution for Exemplar-Guided Class-Agnostic Counting. In BMVC. 313."},{"key":"e_1_3_2_1_18_1","first-page":"38","article-title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","author":"Liu Shilong","year":"2024","unstructured":"Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, et al., 2024. Grounding dino: Marrying dino with grounded pre-training for open-set object detection. In ECCV. 38-55.","journal-title":"ECCV."},{"key":"e_1_3_2_1_19_1","first-page":"669","article-title":"Class-agnostic counting","author":"Lu Erika","year":"2019","unstructured":"Erika Lu, Weidi Xie, and Andrew Zisserman. 2019. Class-agnostic counting. In ACCV. 669-684.","journal-title":"ACCV."},{"key":"e_1_3_2_1_20_1","first-page":"6142","article-title":"Bayesian loss for crowd count estimation with point supervision","author":"Ma Zhiheng","year":"2019","unstructured":"Zhiheng Ma, Xing Wei, Xiaopeng Hong, and Yihong Gong. 2019. Bayesian loss for crowd count estimation with point supervision. In ICCV. 6142-6151.","journal-title":"ICCV."},{"key":"e_1_3_2_1_21_1","first-page":"785","article-title":"A large contextual dataset for classification, detection and counting of cars with deep learning","author":"Mundhenk T Nathan","year":"2016","unstructured":"T Nathan Mundhenk, Goran Konjevod, Wesam A Sakla, and Kofi Boakye. 2016. A large contextual dataset for classification, detection and counting of cars with deep learning. In ECCV. 785-800.","journal-title":"ECCV."},{"key":"e_1_3_2_1_22_1","first-page":"23293","author":"Pelhan Jer","year":"2024","unstructured":"Jer Pelhan, Vitjan Zavrtanik, Matej Kristan, et al., 2024. DAVE-A Detect-and-Verify Paradigm for Low-Shot Counting. In CVPR. 23293-23302.","journal-title":"DAVE-A Detect-and-Verify Paradigm for Low-Shot Counting. In CVPR."},{"key":"e_1_3_2_1_23_1","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al., 2021. Learning transferable visual models from natural language supervision. In ICML. 8748-8763.","journal-title":"ICML."},{"key":"e_1_3_2_1_24_1","first-page":"3394","article-title":"Learning to count everything","author":"Ranjan Viresh","year":"2021","unstructured":"Viresh Ranjan, Udbhav Sharma, Thu Nguyen, and Minh Hoai. 2021. Learning to count everything. In CVPR. 3394-3403.","journal-title":"CVPR."},{"key":"e_1_3_2_1_25_1","volume-title":"Mukuntha Narayanan Sundararaman, Amogh Kamath, and R Venkatesh Babu.","author":"Sam Deepak Babu","year":"2020","unstructured":"Deepak Babu Sam, Skand Vishwanath Peri, Mukuntha Narayanan Sundararaman, Amogh Kamath, and R Venkatesh Babu. 2020. Locate, size, and count: accurately resolving people in dense crowds via detection. IEEE TPAMI (2020), 2739-2751."},{"key":"e_1_3_2_1_26_1","first-page":"1215","article-title":"End-to-end crowd counting via joint learning local and global count","author":"Shang Chong","year":"2016","unstructured":"Chong Shang, Haizhou Ai, and Bo Bai. 2016. End-to-end crowd counting via joint learning local and global count. In ICIP. 1215-1219.","journal-title":"ICIP."},{"key":"e_1_3_2_1_27_1","first-page":"9529","article-title":"Represent, compare, and learn: A similarity-aware framework for class-agnostic counting","author":"Shi Min","year":"2022","unstructured":"Min Shi, Hao Lu, Chen Feng, Chengxin Liu, and Zhiguo Cao. 2022. Represent, compare, and learn: A similarity-aware framework for class-agnostic counting. In CVPR. 9529-9538.","journal-title":"CVPR."},{"key":"e_1_3_2_1_28_1","first-page":"1861","article-title":"Generating high-quality crowd density maps using contextual pyramid cnns","author":"Sindagi Vishwanath A","year":"2017","unstructured":"Vishwanath A Sindagi and Vishal M Patel. 2017. Generating high-quality crowd density maps using contextual pyramid cnns. In ICCV. 1861-1870.","journal-title":"ICCV."},{"key":"e_1_3_2_1_29_1","first-page":"3365","article-title":"Rethinking counting and localization in crowds: A purely point-based framework","author":"Song Qingyu","year":"2021","unstructured":"Qingyu Song, Changan Wang, Zhengkai Jiang, Yabiao Wang, Ying Tai, Chengjie Wang, Jilin Li, Feiyue Huang, and Yang Wu. 2021a. Rethinking counting and localization in crowds: A purely point-based framework. In ICCV. 3365-3374.","journal-title":"ICCV."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16360"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i6.28396"},{"key":"e_1_3_2_1_32_1","first-page":"15548","article-title":"Zero-Shot Object Counting","author":"Xu Jingyi","year":"2023","unstructured":"Jingyi Xu, Hieu Le, Vu Nguyen, Viresh Ranjan, and Dimitris Samaras. 2023. Zero-Shot Object Counting. In CVPR. 15548-15557.","journal-title":"CVPR."},{"key":"e_1_3_2_1_33_1","first-page":"870","article-title":"Class-agnostic few-shot object counting","author":"Yang Shuo-Diao","year":"2021","unstructured":"Shuo-Diao Yang, Hung-Ting Su, Winston H Hsu, and Wen-Chin Chen. 2021. Class-agnostic few-shot object counting. In WACV. 870-878.","journal-title":"WACV."},{"key":"e_1_3_2_1_34_1","first-page":"6315","article-title":"Few-shot object counting with similarity-aware feature enhancement","author":"You Zhiyuan","year":"2023","unstructured":"Zhiyuan You, Kai Yang, Wenhan Luo, Xin Lu, Lei Cui, and Xinyi Le. 2023. Few-shot object counting with similarity-aware feature enhancement. In WACV. 6315-6324.","journal-title":"WACV."},{"key":"e_1_3_2_1_35_1","first-page":"16795","article-title":"Conditional Prompt Learning for Vision-Language Models","author":"Zhou Kaiyang","year":"2022","unstructured":"Kaiyang Zhou, Jingkang Yang, Chen Change Loy, and Ziwei Liu. 2022a. Conditional Prompt Learning for Vision-Language Models. In CVPR. 16795-16804.","journal-title":"CVPR."},{"key":"e_1_3_2_1_36_1","volume-title":"Chen Change Loy, and Ziwei Liu","author":"Zhou Kaiyang","year":"2022","unstructured":"Kaiyang Zhou, Jingkang Yang, Chen Change Loy, and Ziwei Liu. 2022b. Learning to Prompt for Vision-Language Models. IJCV (2022), 2337-2348."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3754581","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:13:13Z","timestamp":1765339993000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3754581"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":36,"alternative-id":["10.1145\/3746027.3754581","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3754581","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}