{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T09:06:26Z","timestamp":1784279186378,"version":"3.55.0"},"reference-count":48,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62525106"],"award-info":[{"award-number":["62525106"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62472046"],"award-info":[{"award-number":["62472046"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113846","type":"journal-article","created":{"date-parts":[[2026,4,27]],"date-time":"2026-04-27T16:01:27Z","timestamp":1777305687000},"page":"113846","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PC","title":["CE-CLIP: Cloud\u2013edge collaborative fine-tuning for multimodal adaptation"],"prefix":"10.1016","volume":"179","author":[{"given":"Kejun","family":"Ren","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuntao","family":"Du","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lianming","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunxiang","family":"Yao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wei","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lei","family":"Jin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Li","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113846_b1","doi-asserted-by":"crossref","unstructured":"C. Min, D. Zhao, L. Xiao, J. Zhao, X. Xu, Z. Zhu, L. Jin, J. Li, Y. Guo, J. Xing, et al., Driveworld: 4d pre-trained scene understanding via world models for autonomous driving, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 15522\u201315533.","DOI":"10.1109\/CVPR52733.2024.01470"},{"key":"10.1016\/j.patcog.2026.113846_b2","doi-asserted-by":"crossref","unstructured":"J. Zhao, Y. Cheng, Y. Xu, L. Xiong, J. Li, F. Zhao, K. Jayashree, S. Pranata, S. Shen, J. Xing, et al., Towards pose invariant face recognition in the wild, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 2207\u20132216.","DOI":"10.1109\/CVPR.2018.00235"},{"key":"10.1016\/j.patcog.2026.113846_b3","doi-asserted-by":"crossref","first-page":"486","DOI":"10.1109\/TMM.2021.3128047","article-title":"Anti-UAV: A large-scale benchmark for vision-based UAV tracking","volume":"25","author":"Jiang","year":"2021","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113846_b4","doi-asserted-by":"crossref","first-page":"1436","DOI":"10.1109\/TMM.2023.3282139","article-title":"Rethinking the person localization for single-stage multi-person pose estimation","volume":"26","author":"Jin","year":"2023","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113846_b5","doi-asserted-by":"crossref","unstructured":"L. Jin, C. Xu, X. Wang, Y. Xiao, Y. Guo, X. Nie, J. Zhao, Single-stage is enough: Multi-person absolute 3D pose estimation, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 13086\u201313095.","DOI":"10.1109\/CVPR52688.2022.01274"},{"key":"10.1016\/j.patcog.2026.113846_b6","doi-asserted-by":"crossref","first-page":"3364","DOI":"10.1109\/TMM.2022.3159111","article-title":"Grouping by center: Predicting centripetal offsets for the bottom-up human pose estimation","volume":"25","author":"Jin","year":"2022","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113846_b7","article-title":"Vision-language models for vision tasks: A survey","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113846_b8","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.patcog.2026.113846_b9","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111902","article-title":"MA-FSAR: Multimodal adaptation of CLIP for few-shot action recognition","volume":"169","author":"Xing","year":"2026","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113846_b10","article-title":"CORE-clip: Smart collaborative reasoning driven by CLIP for human-object interaction detection","author":"Yang","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113846_b11","article-title":"Activityclip: enhancing group activity recognition by mining complementary information from text to supplement image modality","author":"Xu","year":"2025","journal-title":"Pattern Recognit."},{"issue":"2","key":"10.1016\/j.patcog.2026.113846_b12","doi-asserted-by":"crossref","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","article-title":"Clip-adapter: Better vision-language models with feature adapters","volume":"132","author":"Gao","year":"2024","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.113846_b13","doi-asserted-by":"crossref","unstructured":"M. Zanella, I. Ben Ayed, Low-rank few-shot adaptation of vision-language models, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 1593\u20131603.","DOI":"10.1109\/CVPRW63382.2024.00166"},{"key":"10.1016\/j.patcog.2026.113846_b14","doi-asserted-by":"crossref","unstructured":"M.U. Khattak, H. Rasheed, M. Maaz, S. Khan, F.S. Khan, Maple: Multi-modal prompt learning, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 19113\u201319122.","DOI":"10.1109\/CVPR52729.2023.01832"},{"key":"10.1016\/j.patcog.2026.113846_b15","series-title":"International Conference on Machine Learning","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","author":"Jia","year":"2021"},{"key":"10.1016\/j.patcog.2026.113846_b16","doi-asserted-by":"crossref","unstructured":"X. Zhai, B. Mustafa, A. Kolesnikov, L. Beyer, Sigmoid loss for language image pre-training, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 11975\u201311986.","DOI":"10.1109\/ICCV51070.2023.01100"},{"key":"10.1016\/j.patcog.2026.113846_b17","doi-asserted-by":"crossref","unstructured":"Y. Li, H. Fan, R. Hu, C. Feichtenhofer, K. He, Scaling language-image pre-training via masking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 23390\u201323400.","DOI":"10.1109\/CVPR52729.2023.02240"},{"issue":"9","key":"10.1016\/j.patcog.2026.113846_b18","doi-asserted-by":"crossref","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","article-title":"Learning to prompt for vision-language models","volume":"130","author":"Zhou","year":"2022","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.113846_b19","doi-asserted-by":"crossref","unstructured":"K. Zhou, J. Yang, C.C. Loy, Z. Liu, Conditional prompt learning for vision-language models, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 16816\u201316825.","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"10.1016\/j.patcog.2026.113846_b20","doi-asserted-by":"crossref","unstructured":"B. Zhu, Y. Niu, Y. Han, Y. Wu, H. Zhang, Prompt-aligned gradient for prompt tuning, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 15659\u201315669.","DOI":"10.1109\/ICCV51070.2023.01435"},{"key":"10.1016\/j.patcog.2026.113846_b21","doi-asserted-by":"crossref","unstructured":"J. Zhang, S. Wu, L. Gao, H.T. Shen, J. Song, Dept: Decoupled prompt tuning, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 12924\u201312933.","DOI":"10.1109\/CVPR52733.2024.01228"},{"key":"10.1016\/j.patcog.2026.113846_b22","series-title":"Plot: Prompt learning with optimal transport for vision-language models","author":"Chen","year":"2022"},{"key":"10.1016\/j.patcog.2026.113846_b23","doi-asserted-by":"crossref","unstructured":"T. Yu, Z. Lu, X. Jin, Z. Chen, X. Wang, Task residual for tuning vision-language models, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 10899\u201310909.","DOI":"10.1109\/CVPR52729.2023.01049"},{"key":"10.1016\/j.patcog.2026.113846_b24","doi-asserted-by":"crossref","unstructured":"L. Yang, R.-Y. Zhang, Y. Wang, X. Xie, Mma: Multi-modal adapter for vision-language models, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 23826\u201323837.","DOI":"10.1109\/CVPR52733.2024.02249"},{"key":"10.1016\/j.patcog.2026.113846_b25","series-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part III 16","first-page":"698","article-title":"Side-tuning: a baseline for network adaptation via additive side networks","author":"Zhang","year":"2020"},{"key":"10.1016\/j.patcog.2026.113846_b26","doi-asserted-by":"crossref","first-page":"12991","DOI":"10.52202\/068431-0944","article-title":"Lst: Ladder side-tuning for parameter and memory efficient transfer learning","volume":"35","author":"Sung","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113846_b27","doi-asserted-by":"crossref","unstructured":"M. Xu, Z. Zhang, F. Wei, H. Hu, X. Bai, Side adapter network for open-vocabulary semantic segmentation, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 2945\u20132954.","DOI":"10.1109\/CVPR52729.2023.00288"},{"key":"10.1016\/j.patcog.2026.113846_b28","doi-asserted-by":"crossref","unstructured":"Z. Zhang, D. Zhao, X. Miao, G. Oliaro, Z. Zhang, Q. Li, Y. Jiang, Z. Jia, Quantized side tuning: Fast and memory-efficient tuning of quantized large language models, in: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2024, pp. 1\u201317.","DOI":"10.18653\/v1\/2024.acl-long.1"},{"key":"10.1016\/j.patcog.2026.113846_b29","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111460","article-title":"Prompt-ladder: Memory-efficient prompt tuning for vision-language models on edge devices","volume":"163","author":"Cai","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113846_b30","series-title":"IEEE INFOCOM 2024-IEEE Conference on Computer Communications Workshops (INFOCOM WKSHPS)","first-page":"1","article-title":"Adaptive split learning over energy-constrained wireless edge networks","author":"Li","year":"2024"},{"key":"10.1016\/j.patcog.2026.113846_b31","first-page":"8485","article-title":"Splitfed: When federated learning meets split learning","volume":"vol. 36","author":"Thapa","year":"2022"},{"key":"10.1016\/j.patcog.2026.113846_b32","series-title":"Splitlora: A split parameter-efficient fine-tuning framework for large language models","author":"Lin","year":"2024"},{"key":"10.1016\/j.patcog.2026.113846_b33","article-title":"SplitFrozen: Split learning with device-side model frozen for fine-tuning LLM on heterogeneous resource-constrained devices","author":"Ma","year":"2025","journal-title":"IEEE Commun. Mag."},{"key":"10.1016\/j.patcog.2026.113846_b34","article-title":"Split fine-tuning for large language models in wireless networks","author":"Zhang","year":"2025","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"10.1016\/j.patcog.2026.113846_b35","article-title":"Energy-efficient split learning for fine-tuning large language models in edge networks","author":"Li","year":"2025","journal-title":"IEEE Netw. Lett."},{"key":"10.1016\/j.patcog.2026.113846_b36","series-title":"2009 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"248","article-title":"Imagenet: A large-scale hierarchical image database","author":"Deng","year":"2009"},{"key":"10.1016\/j.patcog.2026.113846_b37","series-title":"2004 Conference on Computer Vision and Pattern Recognition Workshop","first-page":"178","article-title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories","author":"Fei-Fei","year":"2004"},{"key":"10.1016\/j.patcog.2026.113846_b38","series-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3498","article-title":"Cats and dogs","author":"Parkhi","year":"2012"},{"key":"10.1016\/j.patcog.2026.113846_b39","doi-asserted-by":"crossref","unstructured":"J. Krause, M. Stark, J. Deng, L. Fei-Fei, 3d object representations for fine-grained categorization, in: Proceedings of the IEEE International Conference on Computer Vision Workshops, 2013, pp. 554\u2013561.","DOI":"10.1109\/ICCVW.2013.77"},{"key":"10.1016\/j.patcog.2026.113846_b40","series-title":"2008 Sixth Indian Conference on Computer Vision, Graphics & Image Processing","first-page":"722","article-title":"Automated flower classification over a large number of classes","author":"Nilsback","year":"2008"},{"key":"10.1016\/j.patcog.2026.113846_b41","series-title":"Computer Vision\u2013ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part VI 13","first-page":"446","article-title":"Food-101\u2013mining discriminative components with random forests","author":"Bossard","year":"2014"},{"key":"10.1016\/j.patcog.2026.113846_b42","series-title":"Fine-grained visual classification of aircraft","author":"Maji","year":"2013"},{"key":"10.1016\/j.patcog.2026.113846_b43","series-title":"2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition","first-page":"3485","article-title":"Sun database: Large-scale scene recognition from abbey to zoo","author":"Xiao","year":"2010"},{"key":"10.1016\/j.patcog.2026.113846_b44","series-title":"UCF101: A dataset of 101 human actions classes from videos in the wild","author":"Soomro","year":"2012"},{"key":"10.1016\/j.patcog.2026.113846_b45","doi-asserted-by":"crossref","unstructured":"M. Cimpoi, S. Maji, I. Kokkinos, S. Mohamed, A. Vedaldi, Describing textures in the wild, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2014, pp. 3606\u20133613.","DOI":"10.1109\/CVPR.2014.461"},{"issue":"7","key":"10.1016\/j.patcog.2026.113846_b46","doi-asserted-by":"crossref","first-page":"2217","DOI":"10.1109\/JSTARS.2019.2918242","article-title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","volume":"12","author":"Helber","year":"2019","journal-title":"IEEE J. Sel. Top. Appl. Earth Obs. Remote. Sens."},{"key":"10.1016\/j.patcog.2026.113846_b47","series-title":"Tip-adapter: Training-free clip-adapter for better vision-language modeling","author":"Zhang","year":"2021"},{"key":"10.1016\/j.patcog.2026.113846_b48","doi-asserted-by":"crossref","unstructured":"H. Yao, R. Zhang, C. Xu, Visual-language prompt tuning with knowledge-guided context optimization, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 6757\u20136767.","DOI":"10.1109\/CVPR52729.2023.00653"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008113?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008113?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T08:40:32Z","timestamp":1784277632000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326008113"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":48,"alternative-id":["S0031320326008113"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113846","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"CE-CLIP: Cloud\u2013edge collaborative fine-tuning for multimodal adaptation","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113846","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113846"}}