{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T14:57:08Z","timestamp":1784300228062,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":51,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,10,28]],"date-time":"2024-10-28T00:00:00Z","timestamp":1730073600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Kuaishou"},{"name":"National Natural Science Foundation of China","award":["Grant No. 62122018, No. 62020106008, No. U22A2097, No. U23A20315"],"award-info":[{"award-number":["Grant No. 62122018, No. 62020106008, No. U22A2097, No. U23A20315"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,10,28]]},"DOI":"10.1145\/3664647.3680839","type":"proceedings-article","created":{"date-parts":[[2024,10,26]],"date-time":"2024-10-26T06:59:27Z","timestamp":1729925967000},"page":"1206-1214","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":16,"title":["MPT: Multi-grained Prompt Tuning for Text-Video Retrieval"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1015-7338","authenticated-orcid":false,"given":"Haonan","family":"Zhang","sequence":"first","affiliation":[{"name":"University of Electronic Science and Technology of China, Sichuan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0672-3790","authenticated-orcid":false,"given":"Pengpeng","family":"Zeng","sequence":"additional","affiliation":[{"name":"Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2522-6394","authenticated-orcid":false,"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[{"name":"Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2549-8322","authenticated-orcid":false,"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[{"name":"Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2999-2088","authenticated-orcid":false,"given":"Heng Tao","family":"Shen","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China &amp; Tongji University, Sichuan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2024,10,28]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00130"},{"key":"e_1_3_2_1_2_1","first-page":"23716","article-title":"Flamingo: a visual language model for few-shot learning","volume":"35","author":"Alayrac Jean-Baptiste","year":"2022","unstructured":"Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katherine Millican, Malcolm Reynolds, et al. 2022. Flamingo: a visual language model for few-shot learning. NeurIPS, Vol. 35 (2022), 23716--23736.","journal-title":"NeurIPS"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Lisa Anne Hendricks Oliver Wang Eli Shechtman Josef Sivic Trevor Darrell and Bryan Russell. 2017. Localizing moments in video with natural language. In ICCV. 5803--5812.","DOI":"10.1109\/ICCV.2017.618"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"crossref","unstructured":"Max Bain Arsha Nagrani G\u00fcl Varol and Andrew Zisserman. 2021. Frozen in time: A joint video and image encoder for end-to-end retrieval. In ICCV. 1728--1738.","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612427"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681656"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548184"},{"key":"e_1_3_2_1_8_1","volume-title":"Activitynet: A large-scale video benchmark for human activity understanding. In CVPR. 961--970.","author":"Heilbron Fabian Caba","year":"2015","unstructured":"Fabian Caba Heilbron, Victor Escorcia, Bernard Ghanem, and Juan Carlos Niebles. 2015. Activitynet: A large-scale video benchmark for human activity understanding. In CVPR. 961--970."},{"key":"e_1_3_2_1_9_1","first-page":"11285","article-title":"Tinytl: Reduce memory, not parameters for efficient on-device learning","volume":"33","author":"Cai Han","year":"2020","unstructured":"Han Cai, Chuang Gan, Ligeng Zhu, and Song Han. 2020. Tinytl: Reduce memory, not parameters for efficient on-device learning. NeurIPS, Vol. 33 (2020), 11285--11297.","journal-title":"NeurIPS"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_3"},{"key":"e_1_3_2_1_11_1","first-page":"16664","article-title":"Adaptformer: Adapting vision transformers for scalable visual recognition","volume":"35","author":"Chen Shoufa","year":"2022","unstructured":"Shoufa Chen, Chongjian Ge, Zhan Tong, Jiangliu Wang, Yibing Song, Jue Wang, and Ping Luo. 2022. Adaptformer: Adapting vision transformers for scalable visual recognition. NeurIPS, Vol. 35 (2022), 16664--16678.","journal-title":"NeurIPS"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Xinpeng Ding Nannan Wang Shiwei Zhang De Cheng Xiaomeng Li Ziyuan Huang Mingqian Tang and Xinbo Gao. 2021. Support-set based cross-supervision for video grounding. In ICCV. 11573--11582.","DOI":"10.1109\/ICCV48922.2021.01137"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612583"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Valentin Gabeur Chen Sun Karteek Alahari and Cordelia Schmid. 2020. Multi-modal Transformer for Video Retrieval. In ECCV. 214--229.","DOI":"10.1007\/978-3-030-58548-8_13"},{"key":"e_1_3_2_1_15_1","volume-title":"X-pool: Cross-modal language-video attention for text-video retrieval. In CVPR. 5006--5015.","author":"Gorti Satya Krishna","year":"2022","unstructured":"Satya Krishna Gorti, No\u00ebl Vouitsis, Junwei Ma, Keyvan Golestan, Maksims Volkovs, Animesh Garg, and Guangwei Yu. 2022. X-pool: Cross-modal language-video attention for text-video retrieval. In CVPR. 5006--5015."},{"key":"e_1_3_2_1_16_1","unstructured":"Junxian He Chunting Zhou Xuezhe Ma Taylor Berg-Kirkpatrick and Graham Neubig. 2021. Towards a Unified View of Parameter-Efficient Transfer Learning. In ICLR."},{"key":"e_1_3_2_1_17_1","volume-title":"On the effectiveness of adapter-based tuning for pretrained language model adaptation. arXiv preprint arXiv:2106.03164","author":"He Ruidan","year":"2021","unstructured":"Ruidan He, Linlin Liu, Hai Ye, Qingyu Tan, Bosheng Ding, Liying Cheng, Jia-Wei Low, Lidong Bing, and Luo Si. 2021. On the effectiveness of adapter-based tuning for pretrained language model adaptation. arXiv preprint arXiv:2106.03164 (2021)."},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"crossref","unstructured":"Siteng Huang Biao Gong Yulin Pan Jianwen Jiang Yiliang Lv Yuyuan Li and Donglin Wang. 2023. VoP: Text-Video Co-operative Prompt Tuning for Cross-Modal Retrieval. In CVPR. 6565--6574.","DOI":"10.1109\/CVPR52729.2023.00635"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"crossref","unstructured":"Menglin Jia Luming Tang Bor-Chun Chen Claire Cardie Serge Belongie Bharath Hariharan and Ser-Nam Lim. 2022. Visual prompt tuning. In ECCV. 709--727.","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"crossref","unstructured":"Peng Jin Hao Li Zesen Cheng Jinfa Huang Zhennan Wang Li Yuan Chang Liu and Jie Chen. 2023. Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set Alignment. In IJCAI. 938--946.","DOI":"10.24963\/ijcai.2023\/104"},{"key":"e_1_3_2_1_21_1","volume-title":"Maple: Multi-modal prompt learning. In CVPR. 19113--19122.","author":"Khattak Muhammad Uzair","year":"2023","unstructured":"Muhammad Uzair Khattak, Hanoona Rasheed, Muhammad Maaz, Salman Khan, and Fahad Shahbaz Khan. 2023. Maple: Multi-modal prompt learning. In CVPR. 19113--19122."},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"crossref","unstructured":"Dahye Kim Jungin Park Jiyoung Lee Seongheon Park and Kwanghoon Sohn. 2023. Language-free training for zero-shot video grounding. In WACV. 2539--2548.","DOI":"10.1109\/WACV56688.2023.00257"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Jie Lei Linjie Li Luowei Zhou Zhe Gan Tamara L Berg Mohit Bansal and Jingjing Liu. 2021. Less is more: Clipbert for video-and-language learning via sparse sampling. In CVPR. 7331--7341.","DOI":"10.1109\/CVPR46437.2021.00725"},{"key":"e_1_3_2_1_24_1","volume-title":"The power of scale for parameter-efficient prompt tuning. arXiv preprint arXiv:2104.08691","author":"Lester Brian","year":"2021","unstructured":"Brian Lester, Rami Al-Rfou, and Noah Constant. 2021. The power of scale for parameter-efficient prompt tuning. arXiv preprint arXiv:2104.08691 (2021)."},{"key":"e_1_3_2_1_25_1","first-page":"9694","article-title":"Align before fuse: Vision and language representation learning with momentum distillation","volume":"34","author":"Li Junnan","year":"2021","unstructured":"Junnan Li, Ramprasaath Selvaraju, Akhilesh Gotmare, Shafiq Joty, Caiming Xiong, and Steven Chu Hong Hoi. 2021. Align before fuse: Vision and language representation learning with momentum distillation. NeurIPS, Vol. 34 (2021), 9694--9705.","journal-title":"NeurIPS"},{"key":"e_1_3_2_1_26_1","volume-title":"Xiaogang Wang, Jifeng Dai, Yu Qiao, and Hongsheng Li.","author":"Lin Ziyi","year":"2022","unstructured":"Ziyi Lin, Shijie Geng, Renrui Zhang, Peng Gao, Gerard De Melo, Xiaogang Wang, Jifeng Dai, Yu Qiao, and Hongsheng Li. 2022. Frozen clip models are efficient video learners. In ECCV. Springer, 388--404."},{"key":"e_1_3_2_1_27_1","volume-title":"Sgdr: Stochastic gradient descent with warm restarts. arXiv preprint arXiv:1608.03983","author":"Loshchilov Ilya","year":"2016","unstructured":"Ilya Loshchilov and Frank Hutter. 2016. Sgdr: Stochastic gradient descent with warm restarts. arXiv preprint arXiv:1608.03983 (2016)."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2022.07.028"},{"key":"e_1_3_2_1_29_1","volume-title":"Deem: Diffusion models serve as the eyes of large language models for image perception. arXiv preprint arXiv:2405.15232","author":"Luo Run","year":"2024","unstructured":"Run Luo, Yunshui Li, Longze Chen, Wanwei He, Ting-En Lin, Ziqiang Liu, Lei Zhang, Zikai Song, Xiaobo Xia, Tongliang Liu, et al. 2024. Deem: Diffusion models serve as the eyes of large language models for image perception. arXiv preprint arXiv:2405.15232 (2024)."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Antoine Miech Dimitri Zhukov Jean-Baptiste Alayrac Makarand Tapaswi Ivan Laptev and Josef Sivic. 2019. HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips. In ICCV. 2630--2640.","DOI":"10.1109\/ICCV.2019.00272"},{"key":"e_1_3_2_1_31_1","volume-title":"Expanding language-image pretrained models for general video recognition","author":"Ni Bolin","unstructured":"Bolin Ni, Houwen Peng, Minghao Chen, Songyang Zhang, Gaofeng Meng, Jianlong Fu, Shiming Xiang, and Haibin Ling. 2022. Expanding language-image pretrained models for general video recognition. In ECCV. Springer, 1--18."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW59228.2023.00593"},{"key":"e_1_3_2_1_33_1","volume-title":"Sgva-clip: Semantic-guided visual adapting of vision-language models for few-shot image classification","author":"Peng Fang","year":"2023","unstructured":"Fang Peng, Xiaoshan Yang, Linhui Xiao, Yaowei Wang, and Changsheng Xu. 2023. Sgva-clip: Semantic-guided visual adapting of vision-language models for few-shot image classification. IEEE Transactions on Multimedia (2023)."},{"key":"e_1_3_2_1_34_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021. Learning transferable visual models from natural language supervision. In ICML. PMLR, 8748--8763."},{"key":"e_1_3_2_1_35_1","volume-title":"The long-short story of movie description","author":"Rohrbach Anna","unstructured":"Anna Rohrbach, Marcus Rohrbach, and Bernt Schiele. 2015. The long-short story of movie description. In PR. Springer, 209--221."},{"key":"e_1_3_2_1_36_1","volume-title":"A-okvqa: A benchmark for visual question answering using world knowledge","author":"Schwenk Dustin","year":"2022","unstructured":"Dustin Schwenk, Apoorv Khandelwal, Christopher Clark, Kenneth Marino, and Roozbeh Mottaghi. 2022. A-okvqa: A benchmark for visual question answering using world knowledge. In ECCV. Springer, 146--162."},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.421"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3090595"},{"key":"e_1_3_2_1_39_1","volume-title":"Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks. In CVPR. 5227--5237.","author":"Sung Yi-Lin","year":"2022","unstructured":"Yi-Lin Sung, Jaemin Cho, and Mohit Bansal. 2022. Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks. In CVPR. 5227--5237."},{"key":"e_1_3_2_1_40_1","volume-title":"Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490","author":"Tan Hao","year":"2019","unstructured":"Hao Tan and Mohit Bansal. 2019. Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490 (2019)."},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"crossref","unstructured":"Mingkang Tang Zhanyu Wang Zhenhua Liu Fengyun Rao Dian Li and Xiu Li. 2021. Clip4caption: Clip for video caption. In ACM MM. 4858--4862.","DOI":"10.1145\/3474085.3479207"},{"key":"e_1_3_2_1_42_1","volume-title":"Msr-vtt: A large video description dataset for bridging video and language. In CVPR. 5288--5296.","author":"Xu Jun","year":"2016","unstructured":"Jun Xu, Tao Mei, Ting Yao, and Yong Rui. 2016. Msr-vtt: A large video description dataset for bridging video and language. In CVPR. 5288--5296."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01253"},{"key":"e_1_3_2_1_44_1","volume-title":"DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval. In AAAI.","author":"Yang Xiangpeng","year":"2024","unstructured":"Xiangpeng Yang, Linchao Zhu, Xiaohan Wang, and Yi Yang. 2024. DGL: Dynamic Global-Local Prompt Tuning for Text-Video Retrieval. In AAAI."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"crossref","unstructured":"Youngjae Yu Jongseok Kim and Gunhee Kim. 2018. A joint sequence fusion model for video question answering and retrieval. In ECCV. 471--487.","DOI":"10.1007\/978-3-030-01234-2_29"},{"key":"e_1_3_2_1_46_1","volume-title":"Florence: A new foundation model for computer vision. arXiv preprint arXiv:2111.11432","author":"Yuan Lu","year":"2021","unstructured":"Lu Yuan, Dongdong Chen, Yi-Ling Chen, Noel Codella, Xiyang Dai, Jianfeng Gao, Houdong Hu, Xuedong Huang, Boxin Li, Chunyuan Li, et al. 2021. Florence: A new foundation model for computer vision. arXiv preprint arXiv:2111.11432 (2021)."},{"key":"e_1_3_2_1_47_1","volume-title":"Unified vision and language prompt learning. arXiv preprint arXiv:2210.07225","author":"Zang Yuhang","year":"2022","unstructured":"Yuhang Zang, Wei Li, Kaiyang Zhou, Chen Huang, and Chen Change Loy. 2022. Unified vision and language prompt learning. arXiv preprint arXiv:2210.07225 (2022)."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"crossref","unstructured":"Haonan Zhang Lianli Gao Pengpeng Zeng Alan Hanjalic and Heng Tao Shen. 2023. Depth-aware sparse transformer for video-language learning. In ACM MM. 4778--4787.","DOI":"10.1145\/3581783.3611714"},{"key":"e_1_3_2_1_49_1","volume-title":"UMP: Unified Modality-aware Prompt Tuning for Text-Video Retrieval. TCSVT","author":"Zhang Haonan","year":"2024","unstructured":"Haonan Zhang, Pengpeng Zeng, Lianli Gao, Jingkuan Song, and Heng Tao Shen. 2024. UMP: Unified Modality-aware Prompt Tuning for Text-Video Retrieval. TCSVT (2024)."},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01653-1"},{"key":"e_1_3_2_1_51_1","volume-title":"Complementarity-aware space learning for video-text retrieval. TCSVT","author":"Zhu Jinkuan","year":"2023","unstructured":"Jinkuan Zhu, Pengpeng Zeng, Lianli Gao, Gongfu Li, Dongliang Liao, and Jingkuan Song. 2023. Complementarity-aware space learning for video-text retrieval. TCSVT (2023)."}],"event":{"name":"MM '24: The 32nd ACM International Conference on Multimedia","location":"Melbourne VIC Australia","acronym":"MM '24","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 32nd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3680839","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3664647.3680839","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:18:08Z","timestamp":1750295888000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3680839"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,28]]},"references-count":51,"alternative-id":["10.1145\/3664647.3680839","10.1145\/3664647"],"URL":"https:\/\/doi.org\/10.1145\/3664647.3680839","relation":{},"subject":[],"published":{"date-parts":[[2024,10,28]]},"assertion":[{"value":"2024-10-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}