{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,27]],"date-time":"2026-08-27T02:18:34Z","timestamp":1787797114450,"version":"build-2784847793"},"reference-count":42,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2026,8,27]],"date-time":"2026-08-27T00:00:00Z","timestamp":1787788800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,8,27]],"date-time":"2026-08-27T00:00:00Z","timestamp":1787788800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Intel Serv Robotics"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1007\/s11370-026-00749-8","type":"journal-article","created":{"date-parts":[[2026,8,27]],"date-time":"2026-08-27T02:00:16Z","timestamp":1787796016000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Kitchen robotic manipulation utilizing foundation models"],"prefix":"10.1007","volume":"19","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-3611-0298","authenticated-orcid":false,"given":"Myung-Hwan","family":"Jeon","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5590-1792","authenticated-orcid":false,"given":"Sankalp","family":"Yamsani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9575-2835","authenticated-orcid":false,"given":"Joohyung","family":"Kim","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,8,27]]},"reference":[{"key":"749_CR1","unstructured":"Bao H, Dong L, Piao S, et\u00a0al (2022) Beit: Bert pre-training of image transformers. arXiv:2106.08254"},{"key":"749_CR2","doi-asserted-by":"publisher","unstructured":"Caraffa A, Boscaini D, Hamza A, et\u00a0al (2024) Freeze: training-free zero-shot 6d pose estimation with geometric and vision foundation models. In: European conference on computer vision, Springer, pp 414\u2013431. https:\/\/doi.org\/10.1007\/978-3-031-73226-3_24","DOI":"10.1007\/978-3-031-73226-3_24"},{"key":"749_CR3","doi-asserted-by":"publisher","unstructured":"Carpentier J, Saurel G, Buondonno G, et\u00a0al (2019) The pinocchio c++ library: a fast and flexible implementation of rigid body dynamics algorithms and their analytical derivatives. In: 2019 IEEE\/SICE international symposium on system integration (SII), pp 614\u2013619. https:\/\/doi.org\/10.1109\/SII.2019.8700380","DOI":"10.1109\/SII.2019.8700380"},{"key":"749_CR4","doi-asserted-by":"publisher","first-page":"70","DOI":"10.3389\/frobt.2016.00070","volume":"3","author":"W Crooks","year":"2016","unstructured":"Crooks W, Vukasin G, O\u2019Sullivan M et al (2016) Fin ray\u00ae effect inspired soft robotic gripper: from the robosoft grand challenge toward optimization. Front Robot AI 3:70. https:\/\/doi.org\/10.3389\/frobt.2016.00070","journal-title":"Front Robot AI"},{"key":"749_CR5","unstructured":"Ding B, Xie J, Nie J, et\u00a0al (2024) Vfmm3d: releasing the potential of image by vision foundation model for monocular 3d object detection. arXiv:2404.09431"},{"issue":"5","key":"749_CR6","doi-asserted-by":"publisher","first-page":"3929","DOI":"10.1109\/TRO.2023.3281153","volume":"39","author":"HS Fang","year":"2023","unstructured":"Fang HS, Wang C, Fang H et al (2023) Anygrasp: Robust and efficient grasp perception in spatial and temporal domains. IEEE Trans Rob 39(5):3929\u20133945. https:\/\/doi.org\/10.1109\/TRO.2023.3281153","journal-title":"IEEE Trans Rob"},{"key":"749_CR7","doi-asserted-by":"crossref","unstructured":"Fu S, Yang Q, Mo Q, et\u00a0al (2025) Llmdet: learning strong open-vocabulary object detectors under the supervision of large language models. arXiv:2501.18954","DOI":"10.1109\/CVPR52734.2025.01396"},{"key":"749_CR8","doi-asserted-by":"publisher","unstructured":"Fukuzawa Y, Wang Z, Mori Y, et\u00a0al (2021) A robotic system capable of recognition, grasping, and suction for dishwashing automation. In: 2021 27th international conference on mechatronics and machine vision in practice (M2VIP), pp 369\u2013374. https:\/\/doi.org\/10.1109\/M2VIP49856.2021.9665169","DOI":"10.1109\/M2VIP49856.2021.9665169"},{"issue":"2","key":"749_CR9","doi-asserted-by":"publisher","first-page":"2300","DOI":"10.1109\/TMECH.2025.3579247","volume":"31","author":"Z Gu","year":"2026","unstructured":"Gu Z, Li J, Shen W et al (2026) Humanoid locomotion and manipulation: current progress and challenges in control, planning, and learning. IEEE\/ASME Trans Mechatron 31(2):2300\u20132330. https:\/\/doi.org\/10.1109\/TMECH.2025.3579247","journal-title":"IEEE\/ASME Trans Mechatron"},{"key":"749_CR10","unstructured":"Huang W, Wang C, Zhang R, et\u00a0al (2023) Voxposer: composable 3d value maps for robotic manipulation with language models. arXiv:2307.05973"},{"key":"749_CR11","unstructured":"Kim J, Mathur DC, Shin K, et\u00a0al (2023) Papras: plug-and-play robotic arm system. arXiv:2302.09655"},{"issue":"6","key":"749_CR12","doi-asserted-by":"publisher","first-page":"731","DOI":"10.1177\/02783649231213117","volume":"43","author":"J Kim","year":"2024","unstructured":"Kim J, Jeon MH, Jung S et al (2024) Transpose: Large-scale multispectral dataset for transparent object. Int J Robot Res 43(6):731\u2013738. https:\/\/doi.org\/10.1177\/02783649231213117","journal-title":"Int J Robot Res"},{"key":"749_CR13","unstructured":"Kim MJ, Pertsch K, Karamcheti S, et\u00a0al (2024b) Openvla: an open-source vision-language-action model. arXiv:2406.09246"},{"key":"749_CR14","doi-asserted-by":"publisher","unstructured":"Kuffner J, LaValle S (2000) Rrt-connect: an efficient approach to single-query path planning. In: Proceedings 2000 ICRA. millennium conference. IEEE international conference on robotics and automation. symposia proceedings (Cat. No.00CH37065), pp 995\u20131001 vol.2. https:\/\/doi.org\/10.1109\/ROBOT.2000.844730","DOI":"10.1109\/ROBOT.2000.844730"},{"key":"749_CR15","doi-asserted-by":"publisher","unstructured":"Lim H, Kim D, Shin G, et\u00a0al (2025) Kiss-matcher: Fast and robust point cloud registration revisited. In: 2025 IEEE international conference on robotics and automation (ICRA), pp 11104\u201311111. https:\/\/doi.org\/10.1109\/ICRA55743.2025.11127458","DOI":"10.1109\/ICRA55743.2025.11127458"},{"key":"749_CR16","doi-asserted-by":"publisher","unstructured":"Lin J, Liu L, Lu D, et\u00a0al (2024) Sam-6d: Segment anything model meets zero-shot 6d object pose estimation. In: 2024 IEEE\/CVF conference on computer vision and pattern recognition (CVPR), pp 27906\u201327916. https:\/\/doi.org\/10.1109\/CVPR52733.2024.02636","DOI":"10.1109\/CVPR52733.2024.02636"},{"key":"749_CR17","doi-asserted-by":"crossref","unstructured":"Liu P, Orru Y, Vakil J, et\u00a0al (2024a) Ok-robot: What really matters in integrating open-knowledge models for robotics. arXiv:2401.12202","DOI":"10.15607\/RSS.2024.XX.091"},{"key":"749_CR18","doi-asserted-by":"crossref","unstructured":"Liu S, Zeng Z, Ren T, et\u00a0al (2024b) Grounding dino: marrying dino with grounded pre-training for open-set object detection. arXiv:2303.05499","DOI":"10.1007\/978-3-031-72970-6_3"},{"key":"749_CR19","unstructured":"McDonald M, Yu J (2024) Put it in context with visual foundation models. https:\/\/bostondynamics.com\/blog\/put-it-in-context-with-visual-foundation-models\/"},{"issue":"5","key":"749_CR20","doi-asserted-by":"publisher","first-page":"2234","DOI":"10.1002\/rob.22515","volume":"42","author":"RK Megalingam","year":"2025","unstructured":"Megalingam RK, Vadivel SRR, Kotaprolu SS et al (2025) Cleaning robots: a review of sensor technologies and intelligent control strategies for cleaning. J Field Robot 42(5):2234\u20132259. https:\/\/doi.org\/10.1002\/rob.22515","journal-title":"J Field Robot"},{"key":"749_CR21","doi-asserted-by":"crossref","unstructured":"Murai R, Dexheimer E, Davison AJ (2025) Mast3r-slam: Real-time dense slam with 3d reconstruction priors. arXiv:2412.12392","DOI":"10.1109\/CVPR52734.2025.01556"},{"key":"749_CR22","doi-asserted-by":"publisher","unstructured":"Nguyen VN, Groueix T, Ponimatkin G, et\u00a0al (2023) Cnos: a strong baseline for cad-based novel object segmentation. In: 2023 IEEE\/CVF international conference on computer vision workshops (ICCVW), pp 2126\u20132132. https:\/\/doi.org\/10.1109\/ICCVW60793.2023.00227","DOI":"10.1109\/ICCVW60793.2023.00227"},{"key":"749_CR23","unstructured":"Oquab M, Darcet T, Moutakanni T, et\u00a0al (2024) Dinov2: learning robust visual features without supervision. arXiv:2304.07193"},{"key":"749_CR24","doi-asserted-by":"publisher","unstructured":"O\u2019Neill A, Rehman A, Maddukuri A, et\u00a0al (2024) Open x-embodiment: Robotic learning datasets and rt-x models: open x-embodiment collaboration0. In: 2024 IEEE international conference on robotics and automation (ICRA), pp 6892\u20136903. https:\/\/doi.org\/10.1109\/ICRA57147.2024.10611477","DOI":"10.1109\/ICRA57147.2024.10611477"},{"key":"749_CR25","doi-asserted-by":"publisher","unstructured":"Pan J, Chitta S, Manocha D (2012) Fcl: A general purpose library for collision and proximity queries. In: 2012 IEEE international conference on robotics and automation, pp 3859\u20133866. https:\/\/doi.org\/10.1109\/ICRA.2012.6225337","DOI":"10.1109\/ICRA.2012.6225337"},{"issue":"5","key":"749_CR26","doi-asserted-by":"publisher","first-page":"717","DOI":"10.1109\/70.326576","volume":"10","author":"F Park","year":"1994","unstructured":"Park F, Martin B (1994) Robot sensor calibration: solving ax=xb on the euclidean group. IEEE Trans Robot Autom 10(5):717\u2013721. https:\/\/doi.org\/10.1109\/70.326576","journal-title":"IEEE Trans Robot Autom"},{"key":"749_CR27","doi-asserted-by":"publisher","unstructured":"Poiesi F, Boscaini D (2023) Learning general and distinctive 3d local deep descriptors for point cloud registration. IEEE Trans Pattern Anal Mach Intell 45(3):3979\u20133985. https:\/\/doi.org\/10.1109\/TPAMI.2022.3175371","DOI":"10.1109\/TPAMI.2022.3175371"},{"key":"749_CR28","doi-asserted-by":"publisher","unstructured":"Qin Z, Yu H, Wang C et al (2023) Geotransformer: fast and robust point cloud registration with geometric transformer. IEEE Trans Pattern Anal Mach Intell 45(8):9806\u20139821. https:\/\/doi.org\/10.1109\/TPAMI.2023.3259038","DOI":"10.1109\/TPAMI.2023.3259038"},{"key":"749_CR29","unstructured":"Radford A, Kim JW, Hallacy C, et\u00a0al (2021) Learning transferable visual models from natural language supervision. arXiv:2103.00020"},{"key":"749_CR30","unstructured":"Ravi N, Gabeur V, Hu YT, et\u00a0al (2024) Sam 2: Segment anything in images and videos. arXiv:2408.00714"},{"key":"749_CR31","doi-asserted-by":"publisher","unstructured":"Seo M, Lim H, Lee K, et\u00a0al (2025) Buffer-x: Towards zero-shot point cloud registration in diverse scenes. In: 2025 IEEE\/CVF international conference on computer vision (ICCV), pp 3851\u20133862, https:\/\/doi.org\/10.1109\/ICCV51701.2025.00367","DOI":"10.1109\/ICCV51701.2025.00367"},{"key":"749_CR32","doi-asserted-by":"publisher","first-page":"12418","DOI":"10.1109\/TASE.2025.3542418","volume":"22","author":"C Tang","year":"2025","unstructured":"Tang C, Huang D, Dong W et al (2025) Foundationgrasp: generalizable task-oriented grasping with foundation models. IEEE Trans Autom Sci Eng 22:12418\u201312435. https:\/\/doi.org\/10.1109\/TASE.2025.3542418","journal-title":"IEEE Trans Autom Sci Eng"},{"key":"749_CR33","doi-asserted-by":"crossref","unstructured":"Team OM, Ghosh D, Walke H, et\u00a0al (2024) Octo: An open-source generalist robot policy. arXiv:2405.12213","DOI":"10.15607\/RSS.2024.XX.090"},{"key":"749_CR34","unstructured":"Toyota-Research-Institute (2019) Tri taking on the hard problems in manipulation research toward making human-assist robots reliable and robust. https:\/\/www.tri.global\/news\/tri-taking-hard-problems-manipulation-research-toward-making-human-assist-robots-reliable\/"},{"key":"749_CR35","unstructured":"Unitree-Robotics (2024) Unitree robotics. https:\/\/www.unitree.com\/"},{"key":"749_CR36","doi-asserted-by":"publisher","unstructured":"Vuong AD, Vu MN, Le H, et\u00a0al (2024) Grasp-anything: Large-scale grasp dataset from foundation models. In: 2024 IEEE international conference on robotics and automation (ICRA), pp 14030\u201314037. https:\/\/doi.org\/10.1109\/ICRA57147.2024.10611277","DOI":"10.1109\/ICRA57147.2024.10611277"},{"key":"749_CR37","doi-asserted-by":"publisher","unstructured":"Wang S, Leroy V, Cabon Y, et\u00a0al (2024) Dust3r: Geometric 3d vision made easy. In: 2024 IEEE\/CVF conference on computer vision and pattern recognition (CVPR), pp 20697\u201320709. https:\/\/doi.org\/10.1109\/CVPR52733.2024.01956","DOI":"10.1109\/CVPR52733.2024.01956"},{"key":"749_CR38","doi-asserted-by":"crossref","unstructured":"Wen B, Yang W, Kautz J, et\u00a0al (2024) Foundationpose: Unified 6d pose estimation and tracking of novel objects. arXiv:2312.08344","DOI":"10.1109\/CVPR52733.2024.01692"},{"issue":"8","key":"749_CR39","doi-asserted-by":"publisher","first-page":"1087","DOI":"10.1007\/s10514-023-10139-z","volume":"47","author":"J Wu","year":"2023","unstructured":"Wu J, Antonova R, Kan A et al (2023) Tidybot: personalized robot assistance with large language models. Auton Robot 47(8):1087\u20131102. https:\/\/doi.org\/10.1007\/s10514-023-10139-z","journal-title":"Auton Robot"},{"key":"749_CR40","doi-asserted-by":"crossref","unstructured":"Yang L, Kang B, Huang Z, et\u00a0al (2024) Depth anything: unleashing the power of large-scale unlabeled data. arXiv:2401.10891","DOI":"10.1109\/CVPR52733.2024.00987"},{"key":"749_CR41","unstructured":"Zhang S, Lu Q (2024) Innovative integration of visual foundation model with a robotic arm on a mobile platform. arXiv:2404.18720"},{"key":"749_CR42","unstructured":"Zitkovich B, Yu T, Xu S, et\u00a0al (2023) Rt-2: Vision-language-action models transfer web knowledge to robotic control. In: Proceedings of The 7th conference on robot learning, proceedings of machine learning research, vol 229. PMLR, pp 2165\u20132183. https:\/\/proceedings.mlr.press\/v229\/zitkovich23a.html"}],"container-title":["Intelligent Service Robotics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11370-026-00749-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11370-026-00749-8","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11370-026-00749-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,27]],"date-time":"2026-08-27T02:00:20Z","timestamp":1787796020000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11370-026-00749-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8,27]]},"references-count":42,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2026,9]]}},"alternative-id":["749"],"URL":"https:\/\/doi.org\/10.1007\/s11370-026-00749-8","relation":{},"ISSN":["1861-2776","1861-2784"],"issn-type":[{"value":"1861-2776","type":"print"},{"value":"1861-2784","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,8,27]]},"assertion":[{"value":"4 February 2026","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 August 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 August 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"92"}}