{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T16:01:12Z","timestamp":1784131272367,"version":"3.55.0"},"reference-count":62,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"7","license":[{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Robot. Autom. Lett."],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1109\/lra.2025.3577424","type":"journal-article","created":{"date-parts":[[2025,6,6]],"date-time":"2025-06-06T13:43:39Z","timestamp":1749217419000},"page":"7428-7435","source":"Crossref","is-referenced-by-count":5,"title":["Motion Before Action: Diffusing Object Motion as Manipulation Condition"],"prefix":"10.1109","volume":"10","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-2849-3533","authenticated-orcid":false,"given":"Yue","family":"Su","sequence":"first","affiliation":[{"name":"School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-7859-2592","authenticated-orcid":false,"given":"Xinyu","family":"Zhan","sequence":"additional","affiliation":[{"name":"School of Computer Science, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6309-1160","authenticated-orcid":false,"given":"Hongjie","family":"Fang","sequence":"additional","affiliation":[{"name":"School of Computer Science, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0478-0692","authenticated-orcid":false,"given":"Yong-Lu","family":"Li","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1533-8576","authenticated-orcid":false,"given":"Cewu","family":"Lu","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6366-3192","authenticated-orcid":false,"given":"Lixin","family":"Yang","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1146\/annurev.neuro.26.041002.131052"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.016"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2024.xx.090"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.026"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/IROS58592.2024.10801678"},{"key":"ref6","article-title":"Cage: Causal attention enables data-efficient generalizable robotic manipulation","author":"Xia","year":"2024"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.067"},{"key":"ref8","article-title":"OpenVLA: An open-source vision-language-action model","volume-title":"Proc. 8th Annu. Conf. Robot Learn.","author":"Kim","year":"2024"},{"key":"ref9","article-title":"Reasoning about physical interactions with object-oriented prediction and planning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Janner","year":"2019"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2021.XVII.008"},{"key":"ref11","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. 34th Int. Conf. Neural Inf. Process. Syst.","author":"Ho","year":"2020"},{"key":"ref12","article-title":"Denoising diffusion implicit models","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Song","year":"2021"},{"key":"ref13","first-page":"305","article-title":"ALVINN: An autonomous land vehicle in a neural network","volume-title":"Proc. 2nd Int. Conf. Neural Inf. Process. Syst.","author":"Pomerleau","year":"1988"},{"key":"ref14","first-page":"991","article-title":"BC-Z: Zero-shot task generalization with robotic imitation learning","volume-title":"Proc. 5th Conf. Robot Learn.","author":"Jang","year":"2021"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.025"},{"key":"ref16","first-page":"2165","article-title":"RT-2: Vision-language-action models transfer web knowledge to robotic control","volume-title":"Proc. 7th Conf. Robot Learn.","author":"Zitkovich","year":"2023"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611477"},{"key":"ref18","article-title":"Leveraging locality to boost sample efficiency in robotic manipulation","volume-title":"Proc. Conf. Robot Learn.","author":"Zhang","year":"2024"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611293"},{"key":"ref20","article-title":"FoAM: Foresight-augmented multi-task imitation policy for robotic manipulation","author":"Liu","year":"2024"},{"key":"ref21","article-title":"Egomimic: Scaling imitation learning via egocentric video","author":"Kareer","year":"2024"},{"key":"ref22","first-page":"1678","article-title":"What matters in learning from offline human demonstrations for robot manipulation","volume-title":"Proc. 5th Conf. Robot Learn.","author":"Mandlekar","year":"2021"},{"key":"ref23","first-page":"22955","article-title":"Behavior transformers: Cloning $k$ modes with one stone","volume-title":"Proc. 36th Int. Conf. Neural Inf. Process. Syst.","author":"Shafiullah","year":"2022"},{"key":"ref24","first-page":"26991","article-title":"Behavior generation with latent actions","volume-title":"Proc. 41st Int. Conf. Mach. Learn.","author":"Lee","year":"2024"},{"key":"ref25","article-title":"From play to policy: Conditional behavior generation from uncurated robot data","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Cui","year":"2023"},{"key":"ref26","first-page":"3418","article-title":"Learning generalizable manipulation policies with object-centric 3D representations","volume-title":"Proc. 7th Conf. Robot Learn.","author":"Zhu","year":"2023"},{"key":"ref27","first-page":"1199","article-title":"Viola: Object-centric imitation learning for vision-based robot manipulation","volume-title":"Proc. 6th Conf. Robot Learn.","author":"Zhu","year":"2022"},{"key":"ref28","article-title":"Vision-based manipulation from single human video with open-world object graphs","author":"Zhu","year":"2024"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/IROS47612.2022.9981838"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2020.2965875"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461196"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01324"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.068"},{"key":"ref34","article-title":"Transdiff: Diffusion-based method for manipulating transparent objects using a single RGB-D image","author":"Wang","year":"2025"},{"key":"ref35","article-title":"Flow as the cross-domain manipulation interface","volume-title":"Proc. CoRL","author":"Xu","year":"2024"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73116-7_18"},{"key":"ref37","article-title":"General flow as foundation affordance for scalable robot learning","volume-title":"Proc. CoRL","author":"Yuan","year":"2024"},{"key":"ref38","article-title":"Articulated object manipulation using online axis estimation with sam2-based tracking","author":"Wang","year":"2024"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9811889"},{"key":"ref40","article-title":"Rt-affordance: Affordances are versatile intermediate representations for robot manipulation","author":"Nasiriany","year":"2024"},{"key":"ref41","first-page":"4005","article-title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","volume-title":"Proc. 8th Conf. Robot Learn.","author":"Yuan","year":"2024"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58536-5_24"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01437"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2024.xx.092"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611409"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2022.xviii.018"},{"key":"ref47","first-page":"1222","article-title":"FlowBot : Learning generalized articulated objects manipulation via articulation projection","volume-title":"Proc. 7th Conf. Robot Learn.","author":"Zhang","year":"2023"},{"key":"ref48","first-page":"1038","article-title":"ToolFlowNet: Robotic manipulation with tools via predicting tool flow from point clouds","volume-title":"Proc. 6th Conf. Robot Learn.","author":"Seita","year":"2023"},{"key":"ref49","article-title":"Spot: Se(3) pose trajectory diffusion for object-centric manipulation","author":"Hsu","year":"2024"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00589"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2018.xiv.049"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02030"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01111"},{"key":"ref55","first-page":"1094","article-title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","volume-title":"Proc. CoRL","author":"Yu","year":"2020"},{"key":"ref56","first-page":"32974","article-title":"VRL3: A data-driven framework for visual deep reinforcement learning","volume-title":"Proc. 36th Int. Conf. Neural Inf. Process. Syst.","author":"Wang","year":"2022"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.12794\/metadc1505267"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611615"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00319"},{"key":"ref60","article-title":"Dense policy: Bidirectional autoregressive learning of actions","author":"Su","year":"2025"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01692"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73036-8_27"}],"container-title":["IEEE Robotics and Automation Letters"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/7083369\/11008675\/11027642.pdf?arnumber=11027642","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,9]],"date-time":"2025-07-09T21:09:41Z","timestamp":1752095381000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11027642\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7]]},"references-count":62,"journal-issue":{"issue":"7"},"URL":"https:\/\/doi.org\/10.1109\/lra.2025.3577424","relation":{},"ISSN":["2377-3766","2377-3774"],"issn-type":[{"value":"2377-3766","type":"electronic"},{"value":"2377-3774","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,7]]}}}