{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T19:59:14Z","timestamp":1781294354192,"version":"3.54.1"},"reference-count":30,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62303208"],"award-info":[{"award-number":["62303208"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"Science, Technology, and Innovation Commission of Shenzhen Municipality","doi-asserted-by":"publisher","award":["JCYJ20220530115010023"],"award-info":[{"award-number":["JCYJ20220530115010023"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012245","name":"Science and Technology Planning Project of Guangdong Province","doi-asserted-by":"publisher","award":["2024B1212010002"],"award-info":[{"award-number":["2024B1212010002"]}],"id":[{"id":"10.13039\/501100012245","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/access.2026.3693095","type":"journal-article","created":{"date-parts":[[2026,5,14]],"date-time":"2026-05-14T19:58:44Z","timestamp":1778788724000},"page":"85855-85864","source":"Crossref","is-referenced-by-count":0,"title":["MDP3: A Multimodal 3-D Diffusion Policy for Visuomotor Control"],"prefix":"10.1109","volume":"14","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-2311-9106","authenticated-orcid":false,"given":"Daifeng","family":"Li","sequence":"first","affiliation":[{"name":"School of Automation and Intelligent Manufacturing (AiM), Southern University of Science and Technology, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4563-9206","authenticated-orcid":false,"given":"Junwei","family":"Liu","sequence":"additional","affiliation":[{"name":"School of Automation and Intelligent Manufacturing (AiM), Southern University of Science and Technology, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7511-2870","authenticated-orcid":false,"given":"Wei","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Automation and Intelligent Manufacturing (AiM), Southern University of Science and Technology, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.055"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3180108"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00169"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2473"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.016"},{"key":"ref6","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Ho"},{"key":"ref7","article-title":"Denoising diffusion implicit models","author":"Song","year":"2020","journal-title":"arXiv:2010.02502"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1177\/02783649241273668"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.067"},{"key":"ref10","article-title":"3D diffuser actor: Policy diffusion with 3D scene representations","author":"Ke","year":"2024","journal-title":"arXiv:2402.10885"},{"key":"ref11","article-title":"Mamba policy: Towards efficient 3D diffusion policy with hybrid selective state models","author":"Cao","year":"2024","journal-title":"arXiv:2409.07163"},{"key":"ref12","first-page":"4866","article-title":"GenDP: 3D semantic fields for category-level generalizable diffusion policy","volume-title":"Proc. 8th Conf. Robot Learn. (CoRL)","volume":"270","author":"Wang"},{"key":"ref13","article-title":"3D flow diffusion policy: Visuomotor policy learning via generating flow in 3D space","author":"Noh","year":"2025","journal-title":"arXiv:2509.18676"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/IROS60139.2025.11247358"},{"key":"ref15","first-page":"785","article-title":"Perceiver-actor: A multi-task transformer for robotic manipulation","volume-title":"Proc. Conf. Robot Learn.","author":"Shridhar"},{"key":"ref16","article-title":"Act3D: 3D feature field transformers for multi-task robotic manipulation","author":"Gervet","year":"2023","journal-title":"arXiv:2306.17817"},{"key":"ref17","first-page":"694","article-title":"RVT: Robotic view transformer for 3D object manipulation","volume-title":"Proc. Conf. Robot Learn.","author":"Goyal"},{"key":"ref18","article-title":"A universal semantic-geometric representation for robotic manipulation","author":"Zhang","year":"2023","journal-title":"arXiv:2306.10474"},{"key":"ref19","article-title":"Leveraging locality to boost sample efficiency in robotic manipulation","author":"Zhang","year":"2024","journal-title":"arXiv:2406.10615"},{"key":"ref20","first-page":"1094","article-title":"Meta-World: A benchmark and evaluation for multi-task and meta reinforcement learning","volume-title":"Proc. Conf. Robot Learn.","author":"Yu"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2018.xiv.049"},{"key":"ref22","first-page":"2323","article-title":"ChainedDiffuser: Unifying trajectory diffusion and keypose prediction for robotic manipulation","volume-title":"Proc. 7th Conf. Robot Learn. (CoRL)","volume":"229","author":"Xian"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01712"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1702.01992"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"ref26","article-title":"Towards fusing point cloud and visual representations for imitation learning","author":"Donat","year":"2025","journal-title":"arXiv:2502.12320"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.1988.194354"},{"key":"ref28","first-page":"5099","article-title":"PointNet++: Deep hierarchical feature learning on point sets in a metric space","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"30","author":"Qi"},{"key":"ref29","article-title":"Rethinking network design and local geometry in point cloud: A simple residual MLP framework","author":"Ma","year":"2022","journal-title":"arXiv:2202.07123"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00517"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/11323511\/11517395.pdf?arnumber=11517395","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T19:43:39Z","timestamp":1781293419000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11517395\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":30,"URL":"https:\/\/doi.org\/10.1109\/access.2026.3693095","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}