{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,13]],"date-time":"2026-05-13T19:12:37Z","timestamp":1778699557907,"version":"3.51.4"},"reference-count":73,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.01272","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"13707-13718","source":"Crossref","is-referenced-by-count":1,"title":["RoboTron-Mani: All-in-One Multimodal Large Model for Robotic Manipulation"],"prefix":"10.1109","author":[{"given":"Feng","family":"Yan","sequence":"first","affiliation":[{"name":"Meituan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fanfan","family":"Liu","sequence":"additional","affiliation":[{"name":"Meituan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yiyang","family":"Huang","sequence":"additional","affiliation":[{"name":"Meituan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zechao","family":"Guan","sequence":"additional","affiliation":[{"name":"Meituan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liming","family":"Zheng","sequence":"additional","affiliation":[{"name":"Meituan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yufeng","family":"Zhong","sequence":"additional","affiliation":[{"name":"Meituan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chengjian","family":"Feng","sequence":"additional","affiliation":[{"name":"Meituan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lin","family":"Ma","sequence":"additional","affiliation":[{"name":"Meituan"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Gpt-4 technical report","author":"Achiam","year":"2023","journal-title":"arXiv preprint"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1723"},{"key":"ref3","article-title":"Openflamingo: An opensource framework for training large autoregressive visionlanguage models","author":"Awadalla","year":"2023","journal-title":"arXiv preprint"},{"key":"ref4","article-title":"Qwen technical report","author":"Bai","year":"2023","journal-title":"arXiv preprint"},{"key":"ref5","article-title":"Gr00t n1: An open foundation model for generalist humanoid robots","author":"Bjorck","year":"2025","journal-title":"arXiv preprint"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2025.xxi.010"},{"key":"ref7","article-title":"Zero-shot robotic manipulation with pretrained imageediting diffusion models","author":"Black","year":"2023","journal-title":"arXiv preprint"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.025"},{"key":"ref9","article-title":"Rt- 2: Vision-language-action models transfer web knowledge to robotic control","author":"Brohan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref10","article-title":"Language models are few-shot learners","author":"Brown","journal-title":"arXiv preprint"},{"key":"ref11","article-title":"Sparks of artificial general intelligence: Early experiments with gpt-4","author":"Bubeck","year":"2023","journal-title":"arXiv preprint"},{"key":"ref12","article-title":"Gr2: A generative video-language-action model with webscale knowledge for robot manipulation","author":"Cheang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref13","article-title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model","author":"Hardy Chen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"Playfusion: Skill acquisition via diffusion from language-annotated play","author":"Chen","year":"2023","journal-title":"CoRL"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72643-9_22"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1177\/02783649241273668"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-81-322-3972-7_19"},{"key":"ref18","article-title":"Scaling cross-embodied learning: One policy for manipulation, navigation, locomotion and aviation","author":"Doshi","year":"2024","journal-title":"arXiv preprint"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2025.3619794"},{"key":"ref20","article-title":"Rh20t: A robotic dataset for learning diverse skills in one-shot","author":"Fang","year":"2023","journal-title":"RSS 2023 Workshop on Learning for Task and Motion Planning"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01842"},{"key":"ref22","article-title":"Maniskill 2: A unified benchmark for generalizable manipulation skills","author":"Gu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/s41095-022-0271-y"},{"key":"ref24","article-title":"Prediction with action: Visual policy learning via joint denoising process","volume-title":"The Thirty-eighth Annual Conference on Neural Information Processing Systems","author":"Guo","year":"2024"},{"key":"ref25","first-page":"3766","article-title":"Scaling up and distilling down: Language-guided robot skill acquisition","volume-title":"Conference on Robot Learning","author":"Ha","year":"2023"},{"key":"ref26","author":"Huang","year":"2024","journal-title":"Corki: Enabling real-time embodied ai robots via algorithm-architecture co-design"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2020.2974707"},{"key":"ref28","article-title":"Mail: Improving imitation learning with mamba","author":"Jia","year":"2024","journal-title":"arXiv preprint"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.120"},{"key":"ref30","article-title":"Surgical robot transformer (srt): Imitation learning for surgical tasks","author":"Woong Kim","year":"2024","journal-title":"arXiv preprint"},{"key":"ref31","article-title":"Openvla: An open-source vision-language-action model","author":"Jin Kim","year":"2024","journal-title":"arXiv preprint"},{"key":"ref32","article-title":"Behavior generation with latent actions","author":"Lee","year":"2024","journal-title":"arXiv preprint"},{"key":"ref33","article-title":"Blip-2 : Bootstrapping language-image pre-training with frozen image encoders and large language models","volume-title":"International conference on machine learning, pages 1973019742. PMLR","author":"Li","year":"2023"},{"key":"ref34","article-title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","author":"Li","year":"2024","journal-title":"arXiv preprint"},{"key":"ref35","article-title":"Vision-language foundation models as effective robot imitators","author":"Li","year":"2023","journal-title":"arXiv preprint"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1939"},{"key":"ref37","article-title":"Robouniview: Visual-language model with unified view representation for robotic manipulaiton","author":"Liu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref38","author":"Liu","year":"2024","journal-title":"Llava-next: Improved reasoning, ocr, and world knowledge"},{"key":"ref39","article-title":"Visual instruction tuning","author":"Liu","year":"2024","journal-title":"Advances in neural information processing systems, 36"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0031"},{"key":"ref41","article-title":"What matters in learning from offline human demonstrations for robot manipulation","volume-title":"Conference on Robot Learning (CoRL)","author":"Mandlekar","year":"2021"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3196123"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3180108"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10160396"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10160396"},{"key":"ref46","article-title":"Meta","year":"2024","journal-title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models"},{"key":"ref47","author":"Mete","journal-title":"Quest: Self-supervised skill abstractions for learning continuous control, 2024"},{"key":"ref48","article-title":"R3m: A universal visual representation for robot manipulation","author":"Nair","year":"2022","journal-title":"arXiv preprint"},{"key":"ref49","article-title":"Robocasa: Large-scale simulation of everyday tasks for generalist robots","author":"Nasiriany","year":"2024","journal-title":"arXiv preprint"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2024.xx.050"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2021.3084395"},{"key":"ref52","article-title":"OpenAI","year":"2022","journal-title":"Chatgpt"},{"key":"ref53","article-title":"Open xembodiment: Robotic learning datasets and \\text{rt}-{x} models","author":"Padalkar","year":"2023","journal-title":"arXiv preprint"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2025.XXI.012"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.133"},{"key":"ref56","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"International conference on machine learning","author":"Radford","year":"2021"},{"key":"ref57","author":"Ren","year":"2024","journal-title":"Grounded sam: Assembling open-world models for diverse visual tasks"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2024.xx.121"},{"key":"ref59","article-title":"Mutex: Learning unified policies from multimodal task specifications","volume-title":"7th Annual Conference on Robot Learning","author":"Shah","year":"2023"},{"key":"ref60","first-page":"785","article-title":"Perceiveractor: A multi-task transformer for robotic manipulation","volume-title":"Proceedings of The 6th Conference on Robot Learning","author":"Shridhar","year":"2023"},{"key":"ref61","article-title":"Octo: An open-source generalist robot policy","author":"Model Team","year":"2024","journal-title":"arXiv preprint"},{"key":"ref62","article-title":"Llama: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv preprint"},{"key":"ref63","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arXiv preprint"},{"key":"ref64","article-title":"Scaling proprioceptive-visual learning with heterogeneous pre-trained transformers","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref65","author":"Wang","year":"2024","journal-title":"All robots in one: A new standard and unified dataset for versatile, general-purpose embodied agents"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2024.xx.092"},{"key":"ref67","article-title":"Unleashing large-scale video generative pre-training for visual robot manipulation","volume-title":"International Conference on Learning Representations","author":"Wu","year":"2024"},{"key":"ref68","first-page":"1094","article-title":"Metaworld: A benchmark and evaluation for multi-task and meta reinforcement learning","volume-title":"Conference on robot learning","author":"Yu","year":"2020"},{"key":"ref69","article-title":"Language control diffusion: Efficiently scaling through space, time, and tasks","author":"Zhang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.016"},{"key":"ref71","article-title":"Robocas: A benchmark for robotic manipulation in complex object arrangement scenarios","author":"Zheng","year":"2024","journal-title":"arXiv preprint"},{"key":"ref72","author":"Zheng","year":"2024","journal-title":"Prise: Learning temporal action abstractions as a sequence compression problem"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3466076"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11445383.pdf?arnumber=11445383","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T05:32:10Z","timestamp":1777613530000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11445383\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":73,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.01272","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}