{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T17:42:05Z","timestamp":1784223725936,"version":"3.55.0"},"reference-count":78,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["FRR2145283,EFRI-2318065"],"award-info":[{"award-number":["FRR2145283,EFRI-2318065"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000006","name":"Office of Naval Research","doi-asserted-by":"publisher","award":["N00014-22-1-2204,N00014-24-1-2550"],"award-info":[{"award-number":["N00014-22-1-2204,N00014-24-1-2550"]}],"id":[{"id":"10.13039\/100000006","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,5,19]]},"DOI":"10.1109\/icra55743.2025.11128444","type":"proceedings-article","created":{"date-parts":[[2025,9,2]],"date-time":"2025-09-02T17:28:56Z","timestamp":1756834136000},"page":"13337-13345","source":"Crossref","is-referenced-by-count":7,"title":["BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation"],"prefix":"10.1109","author":[{"given":"Rutav","family":"Shah","sequence":"first","affiliation":[{"name":"The University of Texas at Austin"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Albert","family":"Yu","sequence":"additional","affiliation":[{"name":"The University of Texas at Austin"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yifeng","family":"Zhu","sequence":"additional","affiliation":[{"name":"The University of Texas at Austin"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuke","family":"Zhu","sequence":"additional","affiliation":[{"name":"The University of Texas at Austin"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Roberto","family":"Mart\u00edn-Mart\u00edn","sequence":"additional","affiliation":[{"name":"The University of Texas at Austin"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2011.5980391"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6906922"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1146\/annurev-control-091420-084139"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1609\/icaps.v20i1.13436"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460689"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1142\/9789813224100_0006"},{"key":"ref7","article-title":"Pdsketch: Integrated planning domain programming and learning","author":"Mao","year":"2023","journal-title":"arXiv preprint"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9561548"},{"key":"ref9","first-page":"287","article-title":"Do as i can, not as i say: Grounding language in robotic affordances","volume-title":"Conference on robot learning","author":"Brohan","year":"2023"},{"key":"ref10","author":"Huang","year":"2022","journal-title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10160591"},{"key":"ref12","article-title":"Sayplan: Grounding large language models using 3d scene graphs for scalable task planning","author":"Rana","year":"2023","journal-title":"arXiv preprint"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3360020"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3441495"},{"key":"ref15","article-title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning","author":"Hu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref16","article-title":"Moka: Open-vocabulary robotic manipulation through mark-based visual prompting","author":"Liu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/IROS58592.2024.10801352"},{"key":"ref18","article-title":"A data-efficient visual-audio representation with intuitive fine-tuning for voice-controlled robots","volume-title":"Conference on Robot Learning","author":"Chang","year":"2023"},{"key":"ref19","first-page":"4247","article-title":"Object goal navigation using goal-oriented semantic exploration","volume":"33","author":"Chaplot","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref20","first-page":"32 340","article-title":"Zson: Zero-shot object-goal navigation using multimodal goal embeddings","volume":"35","author":"Majumdar","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10160969"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/IROS58592.2024.10802716"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3362591"},{"key":"ref24","author":"Yenamandra","year":"2023","journal-title":"Homerobot: Open vocabulary mobile manipulation"},{"key":"ref25","article-title":"Ok-robot: What really matters in integrating open-knowledge models for robotics","author":"Liu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref26","article-title":"Open-world object manipulation using pre-trained vision-language models","author":"Stone","year":"2023","journal-title":"arXiv preprint"},{"key":"ref27","article-title":"Open-vocabulary mobile manipulation in unseen dynamic environments with 3d semantic maps","author":"Qiu","year":"2024","journal-title":"arXivpreprint"},{"key":"ref28","article-title":"Closed-loop open-vocabulary mobile manipulation with gpt-4v","author":"Zhi","year":"2024","journal-title":"arXiv preprint"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/s10648-013-9246-y"},{"key":"ref30","volume-title":"Search and retrieval processes in long-term memory","author":"Shiffrin","year":"1968"},{"key":"ref31","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-662-07933-1","author":"Schuler","year":"1987","journal-title":"Integration von forder-und handhabungseinrich-tungen"},{"key":"ref32","first-page":"341","article-title":"Urmad: An autonomous mobile robot system for the assistance to the disabled","volume-title":"Proc. of the 6th International Conference on Advanced Robotics (ICAR\u201993)","author":"Dario","year":"1993"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1002\/(SICI)1097-4563(199611)13:11<755::AID-ROB6>3.0.CO;2-U"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2004.1308134"},{"key":"ref35","article-title":"The umass mobile manipulator uman: An experimental platform for autonomous mobile manipulation","volume-title":"Workshop on manipulation in human environments at robotics: science and systems","author":"Katz"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1016\/S0921-8890(98)00067-0"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2011.5980058"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6385907"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TRA.2002.807549"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2002.1013391"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2000.895316"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1177\/027836499801700201"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1177\/02783640022067977"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1177\/02783640022067139"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/IRDS.2002.1043994"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2005.1570432"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1002\/tee.23206"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.3390\/machines10020097"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.055"},{"key":"ref50","article-title":"On the opportunities and risks of foundation models","author":"Bommasani","year":"2021","journal-title":"arXiv preprint"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/s10514-023-10133-5"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1007\/s10514-023-10131-7"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10161317"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/iros58592.2024.10801328"},{"key":"ref55","article-title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","author":"Nasiriany","year":"2024","journal-title":"arXiv preprint"},{"key":"ref56","article-title":"Mosaic: A modular system for assistive and interactive cooking","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1145\/641480.641491"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2020.2965078"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1142\/S0219843605000545"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1145\/1342250.1342272"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/IROS45743.2020.9341337"},{"key":"ref62","first-page":"603","article-title":"Hrl4in: Hierarchical reinforcement learning for interactive navigation with mobile manipulators","volume-title":"Conference on Robot Learning","author":"Li","year":"2020"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00974"},{"key":"ref64","article-title":"Camp: Causal multi-policy planning for interactive navigation in multi-room scenes","volume":"36","author":"Wang","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72970-6_3"},{"key":"ref67","author":"Ren","year":"2024","journal-title":"Grounded sam: Assembling open-world models for diverse visual tasks"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-78317-6_34"},{"key":"ref69","article-title":"Learning from failure: Integrating negative examples when fine-tuning large language models as agents","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref70","article-title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","author":"Yang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref71","first-page":"24 824","article-title":"Chain-of-thought prompting elicits reasoning in large language models","volume":"35","author":"Wei","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref72","article-title":"Inner monologue: Embodied reasoning through planning with language models","author":"Huang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref73","author":"Chiang","year":"2024","journal-title":"Chatbot arena: An open platform for evaluating llms by human preference"},{"key":"ref74","article-title":"On tiny episodic memories in continual learning","author":"Chaudhry","year":"2019","journal-title":"arXiv preprint"},{"key":"ref75","article-title":"Dynamics-aware unsupervised discovery of skills","author":"Sharma","year":"2019","journal-title":"arXiv preprint"},{"key":"ref76","article-title":"Guided reinforcement learning with learned skills","author":"Pertsch","year":"2021","journal-title":"arXiv preprint"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1145\/3583741"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9561595"}],"event":{"name":"2025 IEEE International Conference on Robotics and Automation (ICRA)","location":"Atlanta, GA, USA","start":{"date-parts":[[2025,5,19]]},"end":{"date-parts":[[2025,5,23]]}},"container-title":["2025 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11127273\/11127223\/11128444.pdf?arnumber=11128444","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,3]],"date-time":"2025-09-03T06:17:43Z","timestamp":1756880263000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11128444\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,5,19]]},"references-count":78,"URL":"https:\/\/doi.org\/10.1109\/icra55743.2025.11128444","relation":{},"subject":[],"published":{"date-parts":[[2025,5,19]]}}}