{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T10:16:16Z","timestamp":1777889776967,"version":"3.51.4"},"reference-count":61,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100016353","name":"SDSC","doi-asserted-by":"publisher","award":["CIS230391"],"award-info":[{"award-number":["CIS230391"]}],"id":[{"id":"10.13039\/100016353","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100006300","name":"ACES","doi-asserted-by":"publisher","award":["CIS230391"],"award-info":[{"award-number":["CIS230391"]}],"id":[{"id":"10.13039\/100006300","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"U.S. National Science Foundation","doi-asserted-by":"publisher","award":["2138259,2138286,2138307,2137603,2138296"],"award-info":[{"award-number":["2138259,2138286,2138307,2137603,2138296"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.00375","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"3936-3946","source":"Crossref","is-referenced-by-count":0,"title":["Federated Prompt-Tuning with Heterogeneous and Incomplete Multimodal Client Data"],"prefix":"10.1109","author":[{"given":"Thu Hang","family":"Phung","sequence":"first","affiliation":[{"name":"Institute of AI Innovation and Societal Impact, Hanoi University of Science and Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Duong M.","family":"Nguyen","sequence":"additional","affiliation":[{"name":"Institute of AI Innovation and Societal Impact, Hanoi University of Science and Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Thanh Trung","family":"Huynh","sequence":"additional","affiliation":[{"name":"EPFL"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Quoc Viet Hung","family":"Nguyen","sequence":"additional","affiliation":[{"name":"Griffith University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Trong Nghia","family":"Hoang","sequence":"additional","affiliation":[{"name":"Washington State University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Phi Le","family":"Nguyen","sequence":"additional","affiliation":[{"name":"Institute of AI Innovation and Societal Impact, Hanoi University of Science and Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","author":"Arevalo","year":"2017","journal-title":"Gated multimodal units for information fusion"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/3569951.3597559"},{"key":"ref3","article-title":"On the opportunities and risks of foundation models","author":"Bommasani","year":"2021","journal-title":"ArXiv"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10599-4_29"},{"key":"ref5","article-title":"Language models are few-shot learners","author":"Brown","year":"2005","journal-title":"CoRR"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.3390\/s21062212"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3394486.3403182"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/3534678.3539384"},{"key":"ref9","author":"Chen","year":"2022","journal-title":"Fedtune: A deep dive into efficient federated fine-tuning with pre-trained transformers"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2022\/399"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.18653\/vl\/N19-142"},{"key":"ref13","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021","journal-title":"ICLR"},{"key":"ref14","article-title":"Personalized federated learning: A meta-learning approach","author":"Fallah","journal-title":"Computing Research Repository"},{"key":"ref15","first-page":"560","article-title":"Personalized federated domain adaptation for item-to-item recommendation","volume-title":"Proceedings of the Thirty-Ninth Conference on Uncertainty in Artificial Intelligence","author":"Fan","year":"2023"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2023.3302410"},{"key":"ref17","first-page":"2742","article-title":"Collective model fusion for multiple black-box experts","volume-title":"Proceedings of the 36th International Conference on Machine Learning","author":"Hoang","year":"2019"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33017850"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1016\/j.cosrev.2020.100336"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01832"},{"key":"ref21","first-page":"5583","article-title":"Vilt: Vision-and-language transformer without convolution or region supervision","volume-title":"Proceedings of the 38th International Conference on Machine Learning","author":"Kim","year":"2021"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1002\/nav.3800020109"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01435"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"ref26","first-page":"429","article-title":"Federated optimization in heterogeneous networks","volume-title":"Proceedings of Machine Learning and Systems","volume":"2","author":"Li","year":"2020"},{"key":"ref27","article-title":"On the convergence of FedAvg on nonIID data","author":"Li","journal-title":"Computing Research Repository"},{"key":"ref28","article-title":"Lawrence Zitnick. Microsoft coco: Common objects in context","volume-title":"European Conference on Computer Vision","author":"Lin","year":"2014"},{"key":"ref29","author":"Lu","year":"2023","journal-title":"FedCLIP: Fast Generalization and Personalization for CLIP in Federated Learning"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-58923-2_10"},{"key":"ref31","first-page":"1273","article-title":"Communicationefficient learning of deep networks from decentralized data","author":"McMahan","year":"2017","journal-title":"Artificial Intelligence and Statistics"},{"key":"ref32","article-title":"Where to Begin?","author":"Nguyen","year":"2023","journal-title":"On the Impact of Pre-Training and Initialization in Federated Learning"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/NCA61908.2024.00048"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/3545008.3545085"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CCGrid57682.2023.00032"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CANDAR60563.2023.00023"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN60899.2024.10650285"},{"key":"ref38","first-page":"17782","article-title":"Geometric multimodal contrastive representation learning","volume-title":"Proceedings of the 2022 International Conference on Machine Learning","author":"Poklukar","year":"2022"},{"key":"ref39","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021","journal-title":"CoRR"},{"issue":"140","key":"ref40","first-page":"1","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"Journal of Machine Learning Research"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00280"},{"key":"ref42","article-title":"Incentives in private collaborative machine learning","volume-title":"Thirty-seventh Conference on Neural Information Processing Systems","author":"Hwee","year":"2023"},{"key":"ref43","first-page":"21394","article-title":"Personalized federated learning with Moreau envelopes","volume":"33","author":"Dinh","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref44","first-page":"200","article-title":"Multimodal few-shot learning with frozen language models","author":"Tsimpoukelli","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref45","first-page":"38753880","article-title":"Communication-efficient and privacy-preserving featurebased federated transfer learning","volume-title":"Proceedings of the 2022 IEEE Global Communications Conference","author":"Wang","year":"2022"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICMEW.2015.7169757"},{"key":"ref47","article-title":"Probabilistic federated prompt-tuning with non-IID and imbalanced data","volume-title":"The Thirty-eighth Annual Conference on Neural Information Processing Systems","author":"Weng","year":"2024"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2022.01.063"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3611757"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01755"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1080\/01621459.2019.1632079"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1016\/j.comcom.2023.12.003"},{"key":"ref53","article-title":"Bayesian nonparametric federated learning of neural networks","volume-title":"International Conference on Machine Learning","author":"Yurochkin","year":"2019"},{"key":"ref54","first-page":"1095410964","article-title":"Statistical model aggregation via parameter matching","author":"Yurochkin","year":"2019","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3037734"},{"key":"ref56","article-title":"Mllm-fl: Multimodal large language model assisted federated learning on heterogeneous and long-tailed data","author":"Zhang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1177\/14759217211029201"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095356"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01653-1"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2022.04.019"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11445165.pdf?arnumber=11445165","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T05:19:22Z","timestamp":1777612762000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11445165\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":61,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.00375","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}