{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,7]],"date-time":"2026-04-07T16:25:25Z","timestamp":1775579125763,"version":"3.50.1"},"reference-count":79,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,5,19]]},"DOI":"10.1109\/icra55743.2025.11127630","type":"proceedings-article","created":{"date-parts":[[2025,9,2]],"date-time":"2025-09-02T17:28:56Z","timestamp":1756834136000},"page":"8811-8818","source":"Crossref","is-referenced-by-count":3,"title":["Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation"],"prefix":"10.1109","author":[{"given":"Kun","family":"Wu","sequence":"first","affiliation":[{"name":"Syracuse University,NY,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yichen","family":"Zhu","sequence":"additional","affiliation":[{"name":"Midea Group, AI Research Center,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinming","family":"Li","sequence":"additional","affiliation":[{"name":"Shanghai University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junjie","family":"Wen","sequence":"additional","affiliation":[{"name":"East China Normal University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ning","family":"Liu","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,Beijing,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiyuan","family":"Xu","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,Beijing,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jian","family":"Tang","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,Beijing,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Robocat: A selfimproving foundation agent for robotic manipulation","author":"Bousmalis","year":"2023","journal-title":"arXiv preprint"},{"key":"ref2","first-page":"158168","article-title":"Implicit behavioral cloning","volume-title":"Conference on Robot Learning. PMLR","author":"Florence","year":"2022"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.026"},{"issue":"86","key":"ref4","first-page":"2579","article-title":"Visualizing data using t-sne","volume":"9","author":"van der Maaten","year":"2008","journal-title":"Journal of Machine Learning Research"},{"key":"ref5","article-title":"Roboagent: Generalization and efficiency in robot manipulation via semantic augmentations and action chunking","author":"Bharadhwaj","year":"2023","journal-title":"arXiv preprint"},{"key":"ref6","article-title":"Octo: An open-source generalist robot policy","author":"Team","year":"2024","journal-title":"arXiv preprint"},{"key":"ref7","article-title":"Openvla: An open-source vision-language-action model","author":"Kim","year":"2024","journal-title":"arXiv preprint"},{"key":"ref8","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref9","article-title":"Denoising diffusion implicit models","author":"Song","year":"2020","journal-title":"arXiv preprint"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref11","first-page":"36479","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume":"35","author":"Saharia","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref12","article-title":"Policy representation via diffusion probability model for reinforcement learning","author":"Yang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref13","article-title":"Value function estimation using conditional diffusion models for control","author":"Mazoure","year":"2023","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"Edgi: Equivariant diffusion for planning with embodied agents","volume":"36","author":"Brehmer","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref15","article-title":"Reasoning with latent diffusion in offline reinforcement learning","author":"Venkatraman","year":"2023","journal-title":"arXiv preprint"},{"key":"ref16","article-title":"Refining diffusion planner for reliable behavior synthesis by automatic detection of infeasible plans","volume":"36","author":"Lee","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref17","article-title":"Adaptive online replanning with diffusion models","volume":"36","author":"Zhou","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref18","article-title":"Offline reinforcement learning via high-fidelity generative behavior modeling","author":"Chen","year":"2022","journal-title":"arXiv preprint"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.071"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.120"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.051"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01703"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2024.xx.121"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.067"},{"key":"ref25","article-title":"Unifying diffusion models with action detection transformers for multi-task robotic manipulation","volume-title":"7th Annual Conference on Robot Learning","author":"Xian","year":"2023"},{"key":"ref26","first-page":"284","article-title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields","volume-title":"Conference on Robot Learning. PMLR","author":"Ze","year":"2023"},{"key":"ref27","first-page":"3766","article-title":"Scaling up and distilling down: Language-guided robot skill acquisition","volume-title":"Conference on Robot Learning. PMLR","author":"Ha","year":"2023"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.028"},{"key":"ref29","article-title":"Imitating human behaviour with diffusion models","author":"Pearce","year":"2023","journal-title":"arXiv preprint"},{"key":"ref30","article-title":"Sparse diffusion policy: A sparse, reusable, and flexible policy for robot learning","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref31","article-title":"Mail: Improving imitation learning with mamba","author":"Jia","year":"2024","journal-title":"arXiv preprint"},{"key":"ref32","article-title":"Scaling diffusion policy in transformer to 1 billion parameters for robotic manipulation","author":"Zhu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref33","article-title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","author":"Wen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref34","article-title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression","author":"Wen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref35","article-title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control","author":"Wen","year":"2025","journal-title":"arXiv preprint"},{"key":"ref36","article-title":"Learning a diffusion model policy from rewards via q-score matching","author":"Psenka","year":"2023","journal-title":"arXiv preprint"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72946-1_27"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10161569"},{"key":"ref39","article-title":"Shelving, stacking, hanging:Relational pose diffusion for multi-modal rearrangement","author":"Simeonov","year":"2023","journal-title":"arXiv preprint"},{"key":"ref40","article-title":"Learning score-based grasping primitive for human-assisting dexterous grasping","volume":"36","author":"Wu","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref41","first-page":"144","article-title":"Language-guided traffic simulation via scene-level diffusion","volume-title":"Conference on Robot Learning. PMLR","author":"Zhong","year":"2023"},{"key":"ref42","article-title":"Structdiffusion: Object-centric diffusion for semantic rearrangement of novel objects","volume-title":"Workshop on Language and Robotics at CoRL","author":"Liu","year":"2022"},{"key":"ref43","article-title":"Edmp: Ensemble-of-costs-guided diffusion for motion planning","author":"Saha","year":"2023","journal-title":"arXiv preprint"},{"key":"ref44","article-title":"Denoising heat-inspired diffusion with insulators for collision free motion planning","author":"Chang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611525"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10609992"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.025"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/WRC-SARA.2019.8931932"},{"key":"ref49","first-page":"894","article-title":"Cliport: What and where pathways for robotic manipulation","volume-title":"Conference on robot learning. PMLR","author":"Shridhar","year":"2022"},{"key":"ref50","author":"Ze","year":"2023","journal-title":"Visual reinforcement learning with hand-informed representations for dexterous manipulation"},{"key":"ref51","article-title":"Aloha unleashed: A simple recipe for robot dexterity","volume-title":"8th Annual Conference on Robot Learning","author":"Zhao"},{"key":"ref52","article-title":"Aloha 2: An enhanced low-cost hardware for bimanual teleoperation","author":"Aldaco","year":"2024","journal-title":"arXiv preprint"},{"key":"ref53","article-title":"Llara: Supercharging robot learning data for vision-language policy","author":"Li","year":"2024","journal-title":"arXiv preprint"},{"key":"ref54","article-title":"Llarva: Vision-action instruction tuning enhances robot learning","author":"Niu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref55","first-page":"991","article-title":"Bc-z: Zero-shot task generalization with robotic imitation learning","volume-title":"Conference on Robot Learning. PMLR","author":"Jang","year":"2022"},{"key":"ref56","article-title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation","author":"Wu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611477"},{"key":"ref58","article-title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","author":"Brohan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.019"},{"key":"ref60","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref61","first-page":"681","article-title":"Bayesian learning via stochastic gradient langevin dynamics","volume-title":"Proceedings of the 28th international conference on machine learning (ICML-11). Citeseer","author":"Welling","year":"2011"},{"key":"ref62","article-title":"Denoising diffusion implicit models","author":"Song","year":"2020","journal-title":"arXiv preprint"},{"key":"ref63","article-title":"Neural discrete representation learning","volume":"30","author":"Van Den Oord","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref64","article-title":"Auto-encoding variational bayes","author":"Kingma","year":"2013","journal-title":"arXiv preprint"},{"key":"ref65","article-title":"Denoising diffusion implicit models","volume-title":"International Conference on Learning Representations","author":"Song","year":"2021"},{"key":"ref66","article-title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","author":"Sanh","year":"2019","journal-title":"arXiv preprint"},{"key":"ref67","first-page":"6105","article-title":"Efficientnet: Rethinking model scaling for convolutional neural networks","volume-title":"International conference on machine learning. PMLR","author":"Tan","year":"2019"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11671"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"ref70","first-page":"5150","article-title":"Towards human-level bimanual dexterous manipulation with reinforcement learning","volume":"35","author":"Chen","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref71","first-page":"1094","article-title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","volume-title":"Conference on robot learning. PMLR","author":"Yu","year":"2020"},{"key":"ref72","first-page":"1332","article-title":"Masked world models for visual control","volume-title":"Conference on Robot Learning. PMLR","author":"Seo","year":"2023"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.025"},{"key":"ref74","first-page":"22955","article-title":"Behavior transformers: Cloning k k modes with one stone","volume":"35","author":"Shafiullah","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref75","article-title":"Octo: An open-source generalist robot policy","volume-title":"Proceedings of Robotics: Science and Systems","author":"Model Team"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1177\/02783649241273668"},{"key":"ref77","first-page":"17359","article-title":"The unsurprising effectiveness of pre-trained vision models for control","volume-title":"International Conference on Machine Learning. PMLR","author":"Parisi","year":"2022"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00054"},{"key":"ref79","first-page":"158","article-title":"On the direct alignment of latent spaces","volume-title":"Proceedings of UniReps: the First Workshop on Unifying Representations in Neural Models, ser. Proceedings of Machine Learning Research","volume":"243","author":"L\u00e4hner","year":"2024"}],"event":{"name":"2025 IEEE International Conference on Robotics and Automation (ICRA)","location":"Atlanta, GA, USA","start":{"date-parts":[[2025,5,19]]},"end":{"date-parts":[[2025,5,23]]}},"container-title":["2025 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11127273\/11127223\/11127630.pdf?arnumber=11127630","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,3]],"date-time":"2025-09-03T06:05:22Z","timestamp":1756879522000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11127630\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,5,19]]},"references-count":79,"URL":"https:\/\/doi.org\/10.1109\/icra55743.2025.11127630","relation":{},"subject":[],"published":{"date-parts":[[2025,5,19]]}}}