{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,20]],"date-time":"2026-05-20T15:44:55Z","timestamp":1779291895866,"version":"3.51.4"},"reference-count":33,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100021171","name":"Guangdong Basic and Applied Basic Research Foundation","doi-asserted-by":"publisher","award":["2024A1515011774"],"award-info":[{"award-number":["2024A1515011774"]}],"id":[{"id":"10.13039\/501100021171","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.00649","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"6904-6913","source":"Crossref","is-referenced-by-count":2,"title":["FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation"],"prefix":"10.1109","author":[{"given":"Cui","family":"Miao","sequence":"first","affiliation":[{"name":"National University of Defense Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tao","family":"Chang","sequence":"additional","affiliation":[{"name":"National University of Defense Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Meihan","family":"Wu","sequence":"additional","affiliation":[{"name":"National University of Defense Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongbin","family":"Xu","sequence":"additional","affiliation":[{"name":"Bytedance Seed"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chun","family":"Li","sequence":"additional","affiliation":[{"name":"Shenzhen MSU-BIT University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ming","family":"Li","sequence":"additional","affiliation":[{"name":"Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaodong","family":"Wang","sequence":"additional","affiliation":[{"name":"National University of Defense Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Gpt-4 technical report","author":"Achiam","year":"2023","journal-title":"arXiv preprint"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-77287-1_2"},{"key":"ref3","article-title":"Openflamingo: An opensource framework for training large autoregressive visionlanguage models","author":"Awadalla","year":"2023","journal-title":"arXiv preprint"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2244"},{"key":"ref5","article-title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","author":"Brohan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.01368"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01138"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.70"},{"key":"ref9","first-page":"1","volume-title":"Differential privacy. In International colloquium on automata, languages, and programming","author":"Dwork","year":"2006"},{"issue":"110","key":"ref10","first-page":"1","article-title":"Secure multi-party computation. Manuscript","volume":"78","author":"Goldreich","year":"1998","journal-title":"Preliminary version"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1991.3.1.79"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3637528.3671715"},{"key":"ref13","article-title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","author":"Karamcheti","year":"2024","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"Openvla: An open-source vision-language-action model","author":"Jin Kim","year":"2024","journal-title":"arXiv preprint"},{"key":"ref15","article-title":"Vision-language foundation models as effective robot imitators","author":"Li","year":"2023","journal-title":"arXiv preprint"},{"key":"ref16","article-title":"Moe-llava: Mixture of experts for large vision-language models","author":"Lin","year":"2024","journal-title":"arXiv preprint"},{"key":"ref17","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Advances in neural information processing systems"},{"key":"ref18","first-page":"arXiv-2402","article-title":"World model on million-length video and language with ringattention","author":"Liu","year":"2024","journal-title":"arXiv e-prints"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/tmech.2025.3574943"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00535"},{"key":"ref21","article-title":"What matters in learning from offline human demonstrations for robot manipulation","author":"Mandlekar","year":"2021","journal-title":"arXiv preprint"},{"key":"ref22","first-page":"1273","article-title":"Communicationefficient learning of deep networks from decentralized data","author":"McMahan","year":"2017","journal-title":"Artificial intelligence and statistics"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1075\/li.30.1.03nad"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611477"},{"key":"ref25","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"International conference on machine learning","author":"Radford"},{"key":"ref26","article-title":"Gemini: a family of highly capable multimodal models","author":"Team","year":"2023","journal-title":"arXiv preprint"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ADICS58448.2024.10533619"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.52202\/079017-3952"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3657922"},{"key":"ref30","first-page":"1094","article-title":"Metaworld: A benchmark and evaluation for multi-task and meta reinforcement learning","volume-title":"Conference on robot learning","author":"Yu"},{"key":"ref31","article-title":"Robotic control via embodied chain-of-thought reasoning","author":"Zawalski","year":"2024","journal-title":"arXiv preprint"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_39"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02140"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11445546.pdf?arnumber=11445546","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T05:04:23Z","timestamp":1777611863000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11445546\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":33,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.00649","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}