{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,19]],"date-time":"2025-12-19T08:19:07Z","timestamp":1766132347696,"version":"3.48.0"},"reference-count":62,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"Science and Technology Project of Gansu","award":["24JRRA388"],"award-info":[{"award-number":["24JRRA388"]}]},{"name":"Gansu Haizhi Characteristic Demonstration","award":["GSHZTS 2022-2"],"award-info":[{"award-number":["GSHZTS 2022-2"]}]},{"name":"Supercomputing Center of Lanzhou University"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Multimedia"],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/tmm.2025.3618557","type":"journal-article","created":{"date-parts":[[2025,10,20]],"date-time":"2025-10-20T17:57:06Z","timestamp":1760983026000},"page":"9918-9930","source":"Crossref","is-referenced-by-count":0,"title":["MIP-CLIP: Multimodal Independent Prompt CLIP for Action Recognition"],"prefix":"10.1109","volume":"27","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0899-6565","authenticated-orcid":false,"given":"Xiong","family":"Gao","sequence":"first","affiliation":[{"name":"School of Information Science and Engineering, Lanzhou University, Lanzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1574-979X","authenticated-orcid":false,"given":"Zhaobin","family":"Chang","sequence":"additional","affiliation":[{"name":"School of Information Science and Engineering, Lanzhou University, Lanzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dongyi","family":"Kong","sequence":"additional","affiliation":[{"name":"School of Information Science and Engineering, Lanzhou University, Lanzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1634-9840","authenticated-orcid":false,"given":"Huiyu","family":"Zhou","sequence":"additional","affiliation":[{"name":"School of Computing and Mathematical Sciences, University of Leicester, Leicester, U.K."}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8926-2039","authenticated-orcid":false,"given":"Yonggang","family":"Lu","sequence":"additional","affiliation":[{"name":"School of Information Science and Engineering, Lanzhou University, Lanzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.2965434"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3139768"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3148588"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3318300"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3224327"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/WACV45572.2020.9093274"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3173658"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00099"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00193"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00320"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01367"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00476"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2102.05095"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3073248"},{"key":"ref16","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford","year":"2021"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00292"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19833-5_23"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19833-5_7"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02206"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i6.28361"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612490"},{"article-title":"EZ-CLIP: Efficient zeroshot video action recognition","year":"2023","author":"Ahmad","key":"ref23"},{"article-title":"ActionClip: A new paradigm for video action recognition","year":"2021","author":"Wang","key":"ref24"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19772-7_1"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00640"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2007.383173"},{"issue":"1","key":"ref28","first-page":"2949","article-title":"Multimodal learning with deep Boltzmann machines","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"15","author":"Srivastava","year":"2012"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46478-7_5"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01101"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1250"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01653-1"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"ref34","first-page":"35959","article-title":"PyramidCLIP: Hierarchical feature alignment for vision-language model pretraining","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Gao","year":"2022"},{"key":"ref35","first-page":"9613","article-title":"Filip: Fine-grained interactive language-image pre-training","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Yao","year":"2022"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i3.27955"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1016\/0004-3702(81)90024-2"},{"key":"ref39","first-page":"26462","article-title":"ST-Adapter: Parameter-efficient image-to-video transfer learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Pan","year":"2022"},{"key":"ref40","first-page":"10959","article-title":"AIM: Adapting image models for efficient video action recognition","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Yang","year":"2023"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P16-1162"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i6.28423"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1212.0402"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2019.00349"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3180585"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3250646"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3321141"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2024.111852"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3319140"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01403"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01825"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3390133"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i4.16401"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3076522"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3207518"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_49"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01345"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01338"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46475-6_22"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01832"}],"container-title":["IEEE Transactions on Multimedia"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6046\/10844992\/11207741.pdf?arnumber=11207741","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,19]],"date-time":"2025-12-19T08:14:59Z","timestamp":1766132099000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11207741\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":62,"URL":"https:\/\/doi.org\/10.1109\/tmm.2025.3618557","relation":{},"ISSN":["1520-9210","1941-0077"],"issn-type":[{"type":"print","value":"1520-9210"},{"type":"electronic","value":"1941-0077"}],"subject":[],"published":{"date-parts":[[2025]]}}}